huggingface / huggingface/diffusers
Support for hpcaitech OpenSora's STDiT for text2video and text2image generation
- Lenguaje dominante
- Python
- Estrellas
- 34.5k
- Forks
- 7.3k
- Merge medio
- 3 d 3 h
- PR fusionados (30 d)
- 91
Descripción
### Model/Pipeline/Scheduler description
STDiT builds on Latte and DiT and yields a trade-off between generation quality and speed
https://github-production-user-asset-6210df.s3.amazonaws.com/99191637/313485495-983a1965-a374-41a7-a76b-c07941a6c1e9.mp4?X-Amz-Algorithm=AWS4-HMAC-SHA256&X-Amz-Credential=AKIAVCODYLSA53PQK4ZA%2F20240318%2Fus-east-1%2Fs3%2Faws4_request&X-Amz-Date=20240318T093601Z&X-Amz-Expires=300&X-Amz-Signature=89fc6e69755160d4b0c00efc5a166a04405f29a99f464410dfa53b73e251a0fd&X-Amz-SignedHeaders=host&actor_id=14872007&key_id=0&repo_id=760231710
### Open source status
- [X] The model implementation is available.
- [X] The model weights are available (Only relevant if addition is not a scheduler).
### Provide useful links for the implementation
https://github.com/hpcaitech/Open-Sora
https://github.com/hpcaitech/Open-Sora#model-weights
Guía de contribución
Línea de trabajo
No se mencionan archivos del repositorio ni pruebas. Empieza leyendo la implementación enlazada y la información sobre los pesos del modelo de hpcaitech/Open-Sora; después, compara los requisitos de STDiT con la compatibilidad existente de diffusers para text2video y text2image. Se considera completado cuando la compatibilidad con STDiT esté disponible para ambas tareas de generación solicitadas.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python, pytorch
- Área
- ai, machine-learning
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 25/100