AlibabaResearch/flash-llm
Voir sur GitHubFlash-LLM: Enabling Cost-Effective and Highly-Efficient Large Generative Model Inference with Unstructured Sparsity
- Étoiles
- 247
- Forks
- 24
- Issues débutants ouvertes
- 0
- Issues indexées
- 7
- Langage dominant
- Cuda
- Licence
- Apache-2.0
- Dernier push GitHub
- 22/9/2023
- Dernière indexation
- 13/9/2026
- Guide de contribution
- Aucun guide de contribution
- Code de conduite
- Aucun code de conduite
- Labels débutants
- Aucun label débutant indexé
- Métriques de merge des PR
- Aucune PR mergée en 30 j
-
Incorpopration with llama 2? Ouverte
AlibabaResearch/flash-llm#8 · 5 commentaires · 0 réactions · 0 personnes assignées ·
-
AlibabaResearch/flash-llm#9 · 3 commentaires · 0 réactions · 0 personnes assignées ·
-
smaller OPT? Ouverte
AlibabaResearch/flash-llm#10 · 0 commentaires · 0 réactions · 0 personnes assignées ·
-
AlibabaResearch/flash-llm#12 · 0 commentaires · 0 réactions · 0 personnes assignées ·
-
AlibabaResearch/flash-llm#13 · 1 commentaire · 0 réactions · 0 personnes assignées ·
-
High error in 50% sparsity Ouverte
AlibabaResearch/flash-llm#14 · 0 commentaires · 0 réactions · 0 personnes assignées ·
-
AlibabaResearch/flash-llm#15 · 0 commentaires · 0 réactions · 0 personnes assignées ·