pytorch / pytorch/executorch

support custom triton sdpa kernel in CUDA backend

Ouverte
#15,744 2 commentaires 0 réactions 1 personne assignée Voir sur GitHub

@Gasoonjia y travaille déjà.

Depuis le 13/11/2025.

Langage dominant
Python
Étoiles
5k
Forks
1.2k
Merge moyen
2 j 10 h
PR mergées (30 j)
581

Description

🚀 The feature, motivation and pitch

Currnently one of the main gap for cuda backend is we don't support sdpa kernel in one step, but need to decompose it which introduces extra perf latency.
We should have a single triton sdpa kernel for CUDA backend.

Alternatives

No response

Additional context

No response

RFC (Optional)

No response

Guide de contribution

Ouvrir le guide de contribution

Par où commencer

  1. Lisez l'issue en entier, puis le guide de contribution du projet.
  2. Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
  3. Forkez le dépôt et travaillez sur une branche.
  4. Ouvrez une pull request qui référence le numéro de l'issue.

Évaluation

Cette issue n'a pas encore été évaluée.

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.