huggingface / huggingface/diffusers
Add support for JoyAI-Video-Edit
- Lenguaje dominante
- Python
- Estrellas
- 34.5k
- Forks
- 7.3k
- Merge medio
- 3 d 3 h
- PR fusionados (30 d)
- 91
Descripción
### Model/Pipeline/Scheduler description
[JoyAI-Video-Edit](https://github.com/jd-opensource/JoyAI-Video-Edit) is an instruction-guided video editing model based on the JoyAI streaming architecture.
It performs causal, chunk-wise video denoising with a per-layer KV cache. Each chunk attends to previously denoised chunks and may additionally attend to an optional reference image.
Prompt embeddings are produced by the external [MiMo-VL](https://huggingface.co/XiaomiMiMo/MiMo-VL-7B-RL-2508) model.
### Open source status
- [x] The model implementation is available.
- [x] The model weights are available (Only relevant if addition is not a scheduler).
### Provide useful links for the implementation
- Reference implementation: https://github.com/jd-opensource/JoyAI-Video-Edit
- Original checkpoint: https://huggingface.co/jdopensource/JoyAI-Video-Edit
- MiMo-VL: https://huggingface.co/XiaomiMiMo/MiMo-VL-7B-RL-2508
Guía de contribución
Línea de trabajo
No se nombran archivos del repositorio, pruebas ni puntos de entrada. Empieza comparando la implementación de referencia y el checkpoint enlazados con las integraciones de modelos de vídeo existentes en diffusers, y determina después cómo encajan en el proyecto los embeddings de prompts de MiMo-VL, la caché KV causal, el denoising por chunks y las imágenes de referencia opcionales. Se considera terminado cuando JoyAI-Video-Edit sea compatible mediante los recursos del modelo enlazados.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python, pytorch
- Área
- computer-vision, machine-learning
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Estado de actividad
- Tranquilo
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 35/100