huggingface / huggingface/diffusers
AttributeError: 'GPT2Model' object has no attribute '_get_initial_cache_position' in AudioLDM2Pipeline
- Lingua principale
- Python
- Stelle
- 34.5k
- Fork
- 7.3k
- Merge medio
- 3g 3h
- PR unite (30g)
- 91
Descrizione
### Describe the bug
```python3
! python3 -m pip install -U phonemizer
! sudo apt install -y --no-install-recommends espeak-ng
import scipy, transformers
import torch
from diffusers import AudioLDM2Pipeline
repo_id = "anhnct/audioldm2_gigaspeech"
pipe = AudioLDM2Pipeline.from_pretrained(repo_id, torch_dtype=torch.float16)
pipe = pipe.to("cuda")
# define the prompts
prompt = "An female actor say with angry voice"
transcript = "wish you have a good day, i hope you never forget me"
negative_prompt = "low quality"
# run the generation
audio = pipe(
prompt,
negative_prompt=negative_prompt,
transcription=transcript,
num_inference_steps=200,
audio_length_in_s=8.0,
num_waveforms_per_prompt=1,
max_new_tokens=512
).audios
# save the best audio sample (index 0) as a .wav file
scipy.io.wavfile.write("techno_2.wav", rate=16000, data=audio[0])
from IPython.display import Audio
Audio("techno_2.wav")
```
keep showing 'GPT2Model' object has no attribute '_get_initial_cache_position's
the problem seems to happen in transformers, I downgrade to transformers==4.47.0 to make it works
### Reproduction
see above
### Logs
```shell
```
### System Info
diffusers 0.34.0, transformers 4.53.3. I test it in kaggle p100
### Who can help?
@yiyixuxu @DN6
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Inizia riproducendo l’esempio di AudioLDM2Pipeline con diffusers 0.34.0 e transformers 4.53.3, quindi confronta il comportamento con transformers 4.47.0. Traccia la chiamata cache-position di GPT2Model nella pipeline AudioLDM2 e la relativa integrazione con Transformers; il lavoro è completato quando la generazione fornita termina senza l’AttributeError, preservando al contempo il comportamento supportato delle dipendenze.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python, pytorch
- Ambito
- machine-learning
- Tipo di issue
- Bug
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Stato di attività
- Ferma
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 35/100