deepseek-ai / deepseek-ai/DeepGEMM
Question about k_grouped_gemm
Open
- Dominant language
- Cuda
- Stars
- 7.8k
- Forks
- 1.3k
- Avg merge
- 3d 7h
- Merged PRs (30d)
- 3
Description
Why, when computing wgrad in k_grouped, do dy and dx use per_channel_cast_to_fp8 instead of per_token_cast_to_fp8?
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.