support custom triton sdpa kernel in CUDA backend
Offen
@Gasoonjia arbeitet bereits daran.
Seit 13.11.2025.
- Vorherrschende Sprache
- Python
- Sterne
- 5k
- Forks
- 1.2k
- Ø Merge
- 2 T. 10 Std.
- Gemergte PRs (30 T.)
- 581
Beschreibung
🚀 The feature, motivation and pitch
Currnently one of the main gap for cuda backend is we don't support sdpa kernel in one step, but need to decompose it which introduces extra perf latency.
We should have a single triton sdpa kernel for CUDA backend.
Alternatives
No response
Additional context
No response
RFC (Optional)
No response
Beitragsleitfaden
Erste Schritte
- Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
- Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
- Forke das Repository und arbeite in einem Branch.
- Öffne einen Pull Request, der die Issue-Nummer nennt.
Bewertung
Dieses Issue wurde noch nicht bewertet.