pytorch / pytorch/executorch

support custom triton sdpa kernel in CUDA backend

Abierto
#15,744 2 comentarios 0 reacciones 1 asignado Ver en GitHub

@Gasoonjia ya está trabajando en esto.

Desde el 13/11/2025.

Lenguaje dominante
Python
Estrellas
5k
Forks
1.2k
Merge medio
2 d 10 h
PR fusionados (30 d)
581

Descripción

🚀 The feature, motivation and pitch

Currnently one of the main gap for cuda backend is we don't support sdpa kernel in one step, but need to decompose it which introduces extra perf latency.
We should have a single triton sdpa kernel for CUDA backend.

Alternatives

No response

Additional context

No response

RFC (Optional)

No response

Guía de contribución

Abrir la guía de contribución

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Evaluación

Este issue todavía no se ha evaluado.

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.