bigscience-workshop/Megatron-DeepSpeed
Ver en GitHubOngoing research training transformer language models at scale, including: BERT & GPT-2
- Estrellas
- 1.4k
- Forks
- 226
- Issues abiertos para principiantes
- 0
- Issues indexados
- 76
- Lenguaje dominante
- Python
- Licencia
- Sin datos de licencia
- Último push a GitHub
- 8/12/2023
- Última indexación
- 14/9/2026
- Guía de contribución
- Sin guía de contribución
- Código de conducta
- Sin código de conducta
- Etiquetas para principiantes
- good first issue
- Métricas de merge de PR
- Sin PR fusionados en 30 d
-
bigscience-workshop/Megatron-DeepSpeed#10 · 1 comentario · 1 reacción · 0 asignados ·
-
arch&scale
bigscience-workshop/Megatron-DeepSpeed#33 · 9 comentarios · 0 reacciones · 1 asignado ·
-
DeBERTa-like attention mechanism Abiertoarch&scale enhancement
bigscience-workshop/Megatron-DeepSpeed#49 · 0 comentarios · 1 reacción · 0 asignados ·
-
🌍 Carbon
bigscience-workshop/Megatron-DeepSpeed#54 · 9 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#57 · 0 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#67 · 1 comentario · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#70 · 2 comentarios · 1 reacción · 0 asignados ·
-
Set up a basic MLflow setup AbiertoMLFlow
bigscience-workshop/Megatron-DeepSpeed#87 · 1 comentario · 0 reacciones · 3 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#95 · 3 comentarios · 1 reacción · 0 asignados ·
-
Double counts in parameter count Abierto
bigscience-workshop/Megatron-DeepSpeed#99 · 2 comentarios · 0 reacciones · 2 asignados ·
-
enhancement
bigscience-workshop/Megatron-DeepSpeed#119 · 9 comentarios · 0 reacciones · 0 asignados ·
-
Need model size dumped at init AbiertoGood First Issue
bigscience-workshop/Megatron-DeepSpeed#123 · 5 comentarios · 0 reacciones · 0 asignados ·
-
Good First Issue Good Second Issue
bigscience-workshop/Megatron-DeepSpeed#124 · 11 comentarios · 0 reacciones · 0 asignados ·
-
arch&scale Good First Issue
bigscience-workshop/Megatron-DeepSpeed#125 · 2 comentarios · 0 reacciones · 1 asignado ·
-
bigscience-workshop/Megatron-DeepSpeed#127 · 0 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#136 · 8 comentarios · 0 reacciones · 0 asignados ·
-
Good First Issue Good Second Issue
bigscience-workshop/Megatron-DeepSpeed#138 · 6 comentarios · 0 reacciones · 1 asignado ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#149 · 10 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#153 · 0 comentarios · 0 reacciones · 0 asignados ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#163 · 14 comentarios · 1 reacción · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#173 · 4 comentarios · 0 reacciones · 1 asignado ·
-
Good Difficult Issue Good First Issue
bigscience-workshop/Megatron-DeepSpeed#174 · 0 comentarios · 0 reacciones · 0 asignados ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#186 · 2 comentarios · 1 reacción · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#189 · 0 comentarios · 0 reacciones · 1 asignado ·
-
bigscience-workshop/Megatron-DeepSpeed#203 · 0 comentarios · 0 reacciones · 1 asignado ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#226 · 2 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#230 · 13 comentarios · 0 reacciones · 1 asignado ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#242 · 2 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#279 · 0 comentarios · 1 reacción · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#280 · 0 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#312 · 0 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#318 · 31 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#319 · 17 comentarios · 0 reacciones · 0 asignados ·
-
"Mask is silently ignored due to the use of a custom kernel" with pretrain_gpt_single_node.sh Abierto
bigscience-workshop/Megatron-DeepSpeed#320 · 4 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#323 · 3 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#324 · 29 comentarios · 0 reacciones · 0 asignados ·
-
Can we also train BLOOM model using tensor using tensor-Parallelism and efficient fused CUDA kernels Abierto
bigscience-workshop/Megatron-DeepSpeed#334 · 4 comentarios · 0 reacciones · 0 asignados ·
-
Finetuning BLOOM Abierto
bigscience-workshop/Megatron-DeepSpeed#337 · 5 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#338 · 4 comentarios · 0 reacciones · 0 asignados ·
-
Installing Apex on Windows Abierto
bigscience-workshop/Megatron-DeepSpeed#342 · 1 comentario · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#343 · 20 comentarios · 0 reacciones · 0 asignados ·
-
grad norm increase strangely Abierto
bigscience-workshop/Megatron-DeepSpeed#347 · 12 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#348 · 5 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#350 · 2 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#355 · 4 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#356 · 3 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#360 · 1 comentario · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#363 · 0 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#364 · 0 comentarios · 0 reacciones · 0 asignados ·
-
bigscience-workshop/Megatron-DeepSpeed#366 · 2 comentarios · 0 reacciones · 0 asignados ·