microsoft / microsoft/TransformerCompression
How to finetune with multi-gpus under data parallel setting?
Nadie ha tomado este issue todavía.
- Lenguaje dominante
- Python
- Estrellas
- 460
- Forks
- 58
- Merge medio
- 8 h 40 min
- PR fusionados (30 d)
- 1
Descripción
Many thanks for sharing the amazing work!
I'm trying to finetune sliced 7b model on some large dataset with millions of samples.
But the distribute-model seems to be model parallel.
How can we finetune on the model with, let's say 8 gpus, under data parallel setting ?
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Línea de trabajo
Empieza leyendo el punto de entrada distribute-model y toda la documentación circundante sobre fine-tuning para determinar en qué se diferencia su comportamiento de paralelismo de modelos de la configuración de paralelismo de datos solicitada. El issue no especifica archivos ni pruebas; para completarlo sería necesario contar con un flujo de fine-tuning multi-GPU acordado y reproducible, o con documentación que explique si es compatible.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python
- Área
- distributed-systems, machine-learning
- Tipo de issue
- Documentación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 20/100