huggingface / huggingface/diffusers
Split Q,K,V vs Fused QKV Projections in diffusers Discussion
- Lenguaje dominante
- Python
- Estrellas
- 34.5k
- Forks
- 7.3k
- Merge medio
- 3 d 3 h
- PR fusionados (30 d)
- 91
Descripción
`diffusers` generally splits fused QKV projections to separate Q, K, V projections in its checkpoint format (for example, for diffusion transformer models). I am interested in collecting feedback on this design choice and any problems which may arise from it. To be honest upfront, I think it is unlikely that we will change this design in the near future, but we would appreciate your feedback nevertheless.
EDIT: the reasoning for using split Q, K, V projections is described in more detail in https://github.com/huggingface/diffusers/issues/14003#issuecomment-4774944332.
Guía de contribución
Línea de trabajo
Comienza con el cuerpo del issue y el comentario enlazado, que explican la justificación del diseño de checkpoints con Q, K, V separados frente a un QKV fusionado. No se identifican archivos, pruebas, puntos de entrada, objetivo de implementación ni criterios de finalización; no se define qué significa estar terminado más allá de recopilar comentarios sobre el diseño.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python, pytorch
- Área
- machine-learning
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Estado de actividad
- Tranquilo
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 25/100