ai-forever / ai-forever/ru-dalle
Sparse attention support
Ouverte
- Langage dominant
- Jupyter Notebook
- Étoiles
- 1.6k
- Forks
- 242
- Métriques de merge des PR
- Aucune PR mergée en 30 j
Description
Currently, the inference code creates the entire attention matrix and then masks it. Sparse attention implementations like Triton are more efficient. Does the pre-training code support sparse attention? Will it ever be released?
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Évaluation
Cette issue n'a pas encore été évaluée.