bigscience-workshop/Megatron-DeepSpeed
View on GitHubOngoing research training transformer language models at scale, including: BERT & GPT-2
- Stars
- 1.4k
- Forks
- 226
- Open beginner issues
- 0
- Indexed issues
- 76
- Dominant language
- Python
- License
- No license data
- Last GitHub push
- Dec 8, 2023
- Latest indexed
- Sep 14, 2026
- Contributing guide
- No contributing guide
- Code of conduct
- No code of conduct
- Beginner labels
- good first issue
- PR merge metrics
- No merged PRs in 30d
-
bigscience-workshop/Megatron-DeepSpeed#10 · 1 comment · 1 reaction · 0 assignees ·
-
arch&scale
bigscience-workshop/Megatron-DeepSpeed#33 · 9 comments · 0 reactions · 1 assignee ·
-
arch&scale enhancement
bigscience-workshop/Megatron-DeepSpeed#49 · 0 comments · 1 reaction · 0 assignees ·
-
🌍 Carbon
bigscience-workshop/Megatron-DeepSpeed#54 · 9 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#57 · 0 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#67 · 1 comment · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#70 · 2 comments · 1 reaction · 0 assignees ·
-
MLFlow
bigscience-workshop/Megatron-DeepSpeed#87 · 1 comment · 0 reactions · 3 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#95 · 3 comments · 1 reaction · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#99 · 2 comments · 0 reactions · 2 assignees ·
-
enhancement
bigscience-workshop/Megatron-DeepSpeed#119 · 9 comments · 0 reactions · 0 assignees ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#123 · 5 comments · 0 reactions · 0 assignees ·
-
Good First Issue Good Second Issue
bigscience-workshop/Megatron-DeepSpeed#124 · 11 comments · 0 reactions · 0 assignees ·
-
arch&scale Good First Issue
bigscience-workshop/Megatron-DeepSpeed#125 · 2 comments · 0 reactions · 1 assignee ·
-
bigscience-workshop/Megatron-DeepSpeed#127 · 0 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#136 · 8 comments · 0 reactions · 0 assignees ·
-
Good First Issue Good Second Issue
bigscience-workshop/Megatron-DeepSpeed#138 · 6 comments · 0 reactions · 1 assignee ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#149 · 10 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#153 · 0 comments · 0 reactions · 0 assignees ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#163 · 14 comments · 1 reaction · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#173 · 4 comments · 0 reactions · 1 assignee ·
-
Good Difficult Issue Good First Issue
bigscience-workshop/Megatron-DeepSpeed#174 · 0 comments · 0 reactions · 0 assignees ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#186 · 2 comments · 1 reaction · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#189 · 0 comments · 0 reactions · 1 assignee ·
-
bigscience-workshop/Megatron-DeepSpeed#203 · 0 comments · 0 reactions · 1 assignee ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#226 · 2 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#230 · 13 comments · 0 reactions · 1 assignee ·
-
Good First Issue
bigscience-workshop/Megatron-DeepSpeed#242 · 2 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#279 · 0 comments · 1 reaction · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#280 · 0 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#312 · 0 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#318 · 31 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#319 · 17 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#320 · 4 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#323 · 3 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#324 · 29 comments · 0 reactions · 0 assignees ·
-
Can we also train BLOOM model using tensor using tensor-Parallelism and efficient fused CUDA kernels Open
bigscience-workshop/Megatron-DeepSpeed#334 · 4 comments · 0 reactions · 0 assignees ·
-
Finetuning BLOOM Open
bigscience-workshop/Megatron-DeepSpeed#337 · 5 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#338 · 4 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#342 · 1 comment · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#343 · 20 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#347 · 12 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#348 · 5 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#350 · 2 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#355 · 4 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#356 · 3 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#360 · 1 comment · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#363 · 0 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#364 · 0 comments · 0 reactions · 0 assignees ·
-
bigscience-workshop/Megatron-DeepSpeed#366 · 2 comments · 0 reactions · 0 assignees ·