deepseek-ai / deepseek-ai/DeepGEMM

Question about k_grouped_gemm

Open
#243 0 comments 0 reactions 0 assignees View on GitHub
Dominant language
Cuda
Stars
7.8k
Forks
1.3k
Avg merge
3d 7h
Merged PRs (30d)
3

Description

Why, when computing wgrad in k_grouped, do dy and dx use per_channel_cast_to_fp8 instead of per_token_cast_to_fp8?

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.