huggingface / huggingface/diffusers
CLIP Score Evaluation without Pre-processing.
Dieses Issue hat noch niemand übernommen.
- Vorherrschende Sprache
- Python
- Sterne
- 34.5k
- Forks
- 7.3k
- Ø Merge
- 3 T. 3 Std.
- Gemergte PRs (30 T.)
- 91
Beschreibung
I am referring to [Evaluating Diffusion Models](https://huggingface.co/docs/diffusers/main/en/conceptual/evaluation), specifically the quantitative evaluation using CLIP score example.
We have images of shape (6, 512, 512, 3).
CLIP score is calculated using `"openai/clip-vit-base-patch16"`.
However, as far as I can tell, the images are not pre-processed to match the format that `"openai/clip-vit-base-patch16"` was trained on (e.g., images of size 224x224 pixels).
Should the images have been processed before or can we still reliably use the CLIP score with the images in their original format?
Please let me know if I have overlooked or am misunderstanding something. Thanks!
Beitragsleitfaden
Erste Schritte
- Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
- Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
- Forke das Repository und arbeite in einem Branch.
- Öffne einen Pull Request, der die Issue-Nummer nennt.
Rechercherichtung
Beginne mit dem Beispiel für den quantitativen CLIP-Score in der Dokumentation zur Evaluierung von Diffusion Models und untersuche, wie die Bilder mit der Form (6, 512, 512, 3) an openai/clip-vit-base-patch16 übergeben werden. Vergleiche diesen Pfad mit den erwarteten Bildeingaben des Modells. Als abgeschlossen gilt die Aufgabe, wenn die Dokumentation klar angibt, ob eine Vorverarbeitung angewendet wird oder erforderlich ist, und das Beispiel bei Bedarf korrigiert wurde.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python, pytorch
- Bereich
- documentation, machine-learning
- Issue-Typ
- Dokumentation
- Schwierigkeit
- 3/5
- Geschätzter Aufwand
- 1-2 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Größtenteils klar
- Anfängerfreundlichkeit
- 35/100