modelscope / modelscope/DiffSynth-Studio
wan_1.3b_vace.py inference problem
Dieses Issue hat noch niemand übernommen.
- Vorherrschende Sprache
- Python
- Sterne
- 13.1k
- Forks
- 1.3k
- Ø Merge
- 13 Std. 12 Min.
- Gemergte PRs (30 T.)
- 45
Beschreibung
This is the error I encountered when running video+image in wan_1.3b_vace.py.
An error occurred when running torchrun --nproc_per_node=2 wan_1.3b_vace.py
The key error message is:
RuntimeError: The size of tensor a (12716) must match the size of tensor b (25432) at non-singleton dimension 1
This error occurs at line 580 in the diffsynth/pipelines/wan_video.py file:
x = x + vace_hints[vace.vace_layers_mapping[block_id]] * vace_scale
The other wan2.1 models can perform inference normally, only vace encounters errors. Changing the resolution still results in a fixed error, with the size of a always being half of b.
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Erste Schritte
- Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
- Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
- Forke das Repository und arbeite in einem Branch.
- Öffne einen Pull Request, der die Issue-Nummer nennt.
Rechercherichtung
Reproduziere den Fehler mit torchrun --nproc_per_node=2 wan_1.3b_vace.py und untersuche anschließend Zeile 580 in diffsynth/pipelines/wan_video.py, insbesondere das VACE-Hint-Mapping, das bei der Tensoraddition verwendet wird. Vergleiche die Tensordimensionen für die VACE- und die anderen Wan-2.1-Inferenzpfade; abgeschlossen ist die Aufgabe, wenn die Video+Image-Inferenz ohne Dimensionsfehler abgeschlossen wird.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python, pytorch
- Bereich
- machine-learning
- Issue-Typ
- Bug
- Schwierigkeit
- 3/5
- Geschätzter Aufwand
- 1-2 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Größtenteils klar
- Anfängerfreundlichkeit
- 48/100