modelscope / modelscope/DiffSynth-Studio
QwenImageVAE tiled decode未实现?
Personne n'a encore pris cette issue.
- Langage dominant
- Python
- Étoiles
- 13.1k
- Forks
- 1.3k
- Merge moyen
- 13 h 12 min
- PR mergées (30 j)
- 45
Description
我看到尽管QwenImagePipeline.__call__有把tiled, tile_size, tile_stride参数传入self.vae.decode,但QwenImageVAE.decode只是用**kwargs接收,并没有实际用到。
https://github.com/modelscope/DiffSynth-Studio/blob/afd101f3452c9ecae0c87b79adfa2e22d65ffdc3/diffsynth/pipelines/qwen_image.py#L444
https://github.com/modelscope/DiffSynth-Studio/blob/afd101f3452c9ecae0c87b79adfa2e22d65ffdc3/diffsynth/models/qwen_image_vae.py#L716
我对模型原理了解有限,想请教一下:请问是 功能暂未实现 还是 QwenImageVAE模型架构本身就无法支持tiled decoding?感谢您的时间和贡献!
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Piste de recherche
Commencez par le point d’entrée lié QwenImagePipeline.call dans diffsynth/pipelines/qwen_image.py et suivez les arguments tiled, tile_size et tile_stride jusqu’à QwenImageVAE.decode dans diffsynth/models/qwen_image_vae.py. Déterminez si ce VAE prend en charge le décodage par tuiles et si les arguments inutilisés représentent une fonctionnalité manquante ; le travail est terminé lorsque le comportement est résolu et couvert par une validation ou une explication appropriée.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- python
- Domaine
- machine-learning
- Type d'issue
- Fonctionnalité
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Activité
- À l'abandon
- Clarté
- Plutôt claire
- Accessibilité débutants
- 35/100