support custom triton sdpa kernel in CUDA backend
Ouverte
@Gasoonjia y travaille déjà.
Depuis le 13/11/2025.
- Langage dominant
- Python
- Étoiles
- 5k
- Forks
- 1.2k
- Merge moyen
- 2 j 10 h
- PR mergées (30 j)
- 581
Description
🚀 The feature, motivation and pitch
Currnently one of the main gap for cuda backend is we don't support sdpa kernel in one step, but need to decompose it which introduces extra perf latency.
We should have a single triton sdpa kernel for CUDA backend.
Alternatives
No response
Additional context
No response
RFC (Optional)
No response
Guide de contribution
Ouvrir le guide de contribution
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Évaluation
Cette issue n'a pas encore été évaluée.