microsoft / microsoft/TransformerCompression

How to finetune with multi-gpus under data parallel setting?

Abierto
#167 1 comentario 0 reacciones 0 asignados Ver en GitHub

Nadie ha tomado este issue todavía.

Lenguaje dominante
Python
Estrellas
460
Forks
58
Merge medio
8 h 40 min
PR fusionados (30 d)
1

Descripción

Many thanks for sharing the amazing work!

I'm trying to finetune sliced 7b model on some large dataset with millions of samples.
But the distribute-model seems to be model parallel.
How can we finetune on the model with, let's say 8 gpus, under data parallel setting ?

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Línea de trabajo

Empieza leyendo el punto de entrada distribute-model y toda la documentación circundante sobre fine-tuning para determinar en qué se diferencia su comportamiento de paralelismo de modelos de la configuración de paralelismo de datos solicitada. El issue no especifica archivos ni pruebas; para completarlo sería necesario contar con un flujo de fine-tuning multi-GPU acordado y reproducible, o con documentación que explique si es compatible.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
python
Área
distributed-systems, machine-learning
Tipo de issue
Documentación
Dificultad
5/5
Tiempo estimado
Más de una semana
Estado de actividad
Estancado
Claridad
Necesita aclaración
Aptitud para principiantes
20/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.