Distributed Training with TensorFlow Java
Personne n'a encore pris cette issue.
- Langage dominant
- Java
- Étoiles
- 928
- Forks
- 227
- Métriques de merge des PR
- Aucune PR mergée en 30 j
Description
Please make sure that this is a feature request. As per our GitHub Policy, we only address code/doc bugs, performance issues, feature requests and build/installation issues on GitHub. tag:feature_template
System information
- TensorFlow version (you are using): 2.X
- Are you willing to contribute it (Yes/No): Yes, when able and available
Describe the feature and the current behavior/state.
Tensorflow on Python has tf.distribute.Strategy API to distribute training across multiple GPUs or multiple machines.
Will this change the current api? How?
Yes, it will add a new awesome feature
Who will benefit with this feature?
- Anyone that requires to speed up training a DL model
- Anyone that requires to train a DL model with big data
- Anyone who wants to create or add Java support for APIs that leverages tf.distribute.Strategy such as TensorflowOnSpark, Spark Tensorflow Distributor or Horovod
Any Other info.
https://www.tensorflow.org/guide/distributed_training
Guide de contribution
Ouvrir le guide de contribution
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Piste de recherche
Commencez par lire le guide de TensorFlow sur l’entraînement distribué et comparer son API tf.distribute.Strategy avec les bindings Java de ce dépôt. Déterminez quelles fonctionnalités d’entraînement distribué et quelle surface de l’API Java sont dans le périmètre, puis définissez des tests ou des exemples démontrant l’entraînement avec plusieurs GPU ou sur plusieurs machines avant l’implémentation.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- java, tensorflow
- Domaine
- distributed-systems, machine-learning
- Type d'issue
- Fonctionnalité
- Difficulté
- 5/5
- Temps estimé
- Plus d'une semaine
- Activité
- À l'abandon
- Clarté
- À clarifier
- Accessibilité débutants
- 20/100