pytorch / pytorch/executorch

support custom triton sdpa kernel in CUDA backend

Aperta
#15,744 2 commenti 0 reazioni 1 assegnatario Vedi su GitHub

@Gasoonjia ci sta già lavorando.

Dal 13/11/2025.

Lingua principale
Python
Stelle
5k
Fork
1.2k
Merge medio
2g 10h
PR unite (30g)
581

Descrizione

🚀 The feature, motivation and pitch

Currnently one of the main gap for cuda backend is we don't support sdpa kernel in one step, but need to decompose it which introduces extra perf latency.
We should have a single triton sdpa kernel for CUDA backend.

Alternatives

No response

Additional context

No response

RFC (Optional)

No response

Guida per i contributori

Apri la guida per i contributori

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Valutazione

Questa issue non è ancora stata valutata.

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.