tensorflow / tensorflow/java

Distributed Training with TensorFlow Java

Ouverte
#369 8 commentaires 1 réaction 0 personnes assignées Voir sur GitHub

Personne n'a encore pris cette issue.

Langage dominant
Java
Étoiles
928
Forks
227
Métriques de merge des PR
Aucune PR mergée en 30 j

Description

Please make sure that this is a feature request. As per our GitHub Policy, we only address code/doc bugs, performance issues, feature requests and build/installation issues on GitHub. tag:feature_template

System information

  • TensorFlow version (you are using): 2.X
  • Are you willing to contribute it (Yes/No): Yes, when able and available

Describe the feature and the current behavior/state.
Tensorflow on Python has tf.distribute.Strategy API to distribute training across multiple GPUs or multiple machines.

Will this change the current api? How?
Yes, it will add a new awesome feature

Who will benefit with this feature?

  • Anyone that requires to speed up training a DL model
  • Anyone that requires to train a DL model with big data
  • Anyone who wants to create or add Java support for APIs that leverages tf.distribute.Strategy such as TensorflowOnSpark, Spark Tensorflow Distributor or Horovod

Any Other info.
https://www.tensorflow.org/guide/distributed_training

Guide de contribution

Ouvrir le guide de contribution

Par où commencer

  1. Lisez l'issue en entier, puis le guide de contribution du projet.
  2. Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
  3. Forkez le dépôt et travaillez sur une branche.
  4. Ouvrez une pull request qui référence le numéro de l'issue.

Piste de recherche

Commencez par lire le guide de TensorFlow sur l’entraînement distribué et comparer son API tf.distribute.Strategy avec les bindings Java de ce dépôt. Déterminez quelles fonctionnalités d’entraînement distribué et quelle surface de l’API Java sont dans le périmètre, puis définissez des tests ou des exemples démontrant l’entraînement avec plusieurs GPU ou sur plusieurs machines avant l’implémentation.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
java, tensorflow
Domaine
distributed-systems, machine-learning
Type d'issue
Fonctionnalité
Difficulté
5/5
Temps estimé
Plus d'une semaine
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
20/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.