bigscience-workshop/Megatron-DeepSpeed
Vedi su GitHubOngoing research training transformer language models at scale, including: BERT & GPT-2
- Stelle
- 1.4k
- Fork
- 226
- Issue aperte per principianti
- 0
- Issue indicizzate
- 76
- Lingua principale
- Python
- Licenza
- Nessun dato sulla licenza
- Ultimo push su GitHub
- 8/12/2023
- Ultima indicizzazione
- 14/9/2026
- Guida per i contributori
- Nessuna guida per i contributori
- Codice di condotta
- Nessun codice di condotta
- Label per principianti
- good first issue
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
-
bigscience-workshop/Megatron-DeepSpeed#10 · 1 commento · 1 reazione · 0 assegnatari ·
-
arch&scale
bigscience-workshop/Megatron-DeepSpeed#33 · 9 commenti · 0 reazioni · 1 assegnatario ·
-
arch&scale enhancement
bigscience-workshop/Megatron-DeepSpeed#49 · 0 commenti · 1 reazione · 0 assegnatari ·
-
🌍 Carbon
bigscience-workshop/Megatron-DeepSpeed#54 · 9 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#57 · 0 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#67 · 1 commento · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#70 · 2 commenti · 1 reazione · 0 assegnatari ·
-
Set up a basic MLflow setup ApertaMLFlow
bigscience-workshop/Megatron-DeepSpeed#87 · 1 commento · 0 reazioni · 3 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#95 · 3 commenti · 1 reazione · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#99 · 2 commenti · 0 reazioni · 2 assegnatari ·
-
enhancement
bigscience-workshop/Megatron-DeepSpeed#119 · 9 commenti · 0 reazioni · 0 assegnatari ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#123 · 5 commenti · 0 reazioni · 0 assegnatari ·
-
Good First Issue Good Second Issue
bigscience-workshop/Megatron-DeepSpeed#124 · 11 commenti · 0 reazioni · 0 assegnatari ·
-
arch&scale Good First Issue
bigscience-workshop/Megatron-DeepSpeed#125 · 2 commenti · 0 reazioni · 1 assegnatario ·
-
bigscience-workshop/Megatron-DeepSpeed#127 · 0 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#136 · 8 commenti · 0 reazioni · 0 assegnatari ·
-
Good First Issue Good Second Issue
bigscience-workshop/Megatron-DeepSpeed#138 · 6 commenti · 0 reazioni · 1 assegnatario ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#149 · 10 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#153 · 0 commenti · 0 reazioni · 0 assegnatari ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#163 · 14 commenti · 1 reazione · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#173 · 4 commenti · 0 reazioni · 1 assegnatario ·
-
Good Difficult Issue Good First Issue
bigscience-workshop/Megatron-DeepSpeed#174 · 0 commenti · 0 reazioni · 0 assegnatari ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#186 · 2 commenti · 1 reazione · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#189 · 0 commenti · 0 reazioni · 1 assegnatario ·
-
bigscience-workshop/Megatron-DeepSpeed#203 · 0 commenti · 0 reazioni · 1 assegnatario ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#226 · 2 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#230 · 13 commenti · 0 reazioni · 1 assegnatario ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#242 · 2 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#279 · 0 commenti · 1 reazione · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#280 · 0 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#312 · 0 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#318 · 31 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#319 · 17 commenti · 0 reazioni · 0 assegnatari ·
-
"Mask is silently ignored due to the use of a custom kernel" with pretrain_gpt_single_node.sh Aperta
bigscience-workshop/Megatron-DeepSpeed#320 · 4 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#323 · 3 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#324 · 29 commenti · 0 reazioni · 0 assegnatari ·
-
Can we also train BLOOM model using tensor using tensor-Parallelism and efficient fused CUDA kernels Aperta
bigscience-workshop/Megatron-DeepSpeed#334 · 4 commenti · 0 reazioni · 0 assegnatari ·
-
Finetuning BLOOM Aperta
bigscience-workshop/Megatron-DeepSpeed#337 · 5 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#338 · 4 commenti · 0 reazioni · 0 assegnatari ·
-
Installing Apex on Windows Aperta
bigscience-workshop/Megatron-DeepSpeed#342 · 1 commento · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#343 · 20 commenti · 0 reazioni · 0 assegnatari ·
-
grad norm increase strangely Aperta
bigscience-workshop/Megatron-DeepSpeed#347 · 12 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#348 · 5 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#350 · 2 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#355 · 4 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#356 · 3 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#360 · 1 commento · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#363 · 0 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#364 · 0 commenti · 0 reazioni · 0 assegnatari ·
-
bigscience-workshop/Megatron-DeepSpeed#366 · 2 commenti · 0 reazioni · 0 assegnatari ·