pytorch / pytorch/executorch

support custom triton sdpa kernel in CUDA backend

オープン
#15,744 コメント 2 件 リアクション 0 件 担当者 1 名 GitHub で見る

@Gasoonjia がすでに取り組んでいます。

2025年11月13日 から。

主要言語
Python
スター
5k
フォーク
1.2k
平均マージ
2日 10時間
マージ済み PR(30日)
581

説明

🚀 The feature, motivation and pitch

Currnently one of the main gap for cuda backend is we don't support sdpa kernel in one step, but need to decompose it which introduces extra perf latency.
We should have a single triton sdpa kernel for CUDA backend.

Alternatives

No response

Additional context

No response

RFC (Optional)

No response

コントリビューションガイド

コントリビューションガイドを開く

はじめの一歩

  1. issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
  2. 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
  3. リポジトリをフォークし、ブランチを切って変更します。
  4. issue 番号を参照したプルリクエストを送ります。

評価

この issue はまだ評価されていません。

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。