deepseek-ai / deepseek-ai/DeepEP
low_latency dispatch_comm_bytes may differ when using BF16 precision.
Open
- Dominant language
- Cuda
- Stars
- 10.1k
- Forks
- 1.4k
- Avg merge
- 4d 1h
- Merged PRs (30d)
- 2
Description
As shown below, i think we should recompute dispatch_comm_bytes when using bf16.
https://github.com/deepseek-ai/DeepEP/blob/29d31c095796f3c8ece47ee9cdcc167051bbeed9/tests/test_low_latency.py#L221
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.