huggingface / huggingface/diffusers

Split Q,K,V vs Fused QKV Projections in diffusers Discussion

Abierto
#14,003 3 comentarios 0 reacciones 0 asignados Ver en GitHub
Lenguaje dominante
Python
Estrellas
34.5k
Forks
7.3k
Merge medio
3 d 3 h
PR fusionados (30 d)
91

Descripción

`diffusers` generally splits fused QKV projections to separate Q, K, V projections in its checkpoint format (for example, for diffusion transformer models). I am interested in collecting feedback on this design choice and any problems which may arise from it. To be honest upfront, I think it is unlikely that we will change this design in the near future, but we would appreciate your feedback nevertheless.

EDIT: the reasoning for using split Q, K, V projections is described in more detail in https://github.com/huggingface/diffusers/issues/14003#issuecomment-4774944332.

Guía de contribución

Abrir la guía de contribución

Línea de trabajo

Comienza con el cuerpo del issue y el comentario enlazado, que explican la justificación del diseño de checkpoints con Q, K, V separados frente a un QKV fusionado. No se identifican archivos, pruebas, puntos de entrada, objetivo de implementación ni criterios de finalización; no se define qué significa estar terminado más allá de recopilar comentarios sobre el diseño.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
python, pytorch
Área
machine-learning
Tipo de issue
Nueva funcionalidad
Dificultad
5/5
Tiempo estimado
Más de una semana
Estado de actividad
Tranquilo
Claridad
Necesita aclaración
Aptitud para principiantes
25/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.