support custom triton sdpa kernel in CUDA backend
オープン
@Gasoonjia がすでに取り組んでいます。
2025年11月13日 から。
- 主要言語
- Python
- スター
- 5k
- フォーク
- 1.2k
- 平均マージ
- 2日 10時間
- マージ済み PR(30日)
- 581
説明
🚀 The feature, motivation and pitch
Currnently one of the main gap for cuda backend is we don't support sdpa kernel in one step, but need to decompose it which introduces extra perf latency.
We should have a single triton sdpa kernel for CUDA backend.
Alternatives
No response
Additional context
No response
RFC (Optional)
No response
コントリビューションガイド
はじめの一歩
- issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
- 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
- リポジトリをフォークし、ブランチを切って変更します。
- issue 番号を参照したプルリクエストを送ります。
評価
この issue はまだ評価されていません。