bigscience-workshop / bigscience-workshop/evaluation
Add ANLI to Full Benchmark
Offen
few_shot
- Vorherrschende Sprache
- Python
- Sterne
- 42
- Forks
- 24
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
use to test generalization to unseen task; maybe use FLEX?
Beitragsleitfaden
Rechercherichtung
Das Issue nennt ANLI, FLEX und den Full Benchmark, aber keine Dateien oder Tests. Beginne damit, den Einstiegspunkt des Full Benchmark und bestehende Benchmark-Integrationen zu finden, und kläre anschließend, ob ANLI oder FLEX vorgesehen ist. Als erledigt gilt die Aufgabe, wenn der ausgewählte Benchmark eingebunden ist und die relevante Generalisierungs-Evaluierung erfolgreich ausgeführt wird.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python
- Bereich
- machine-learning, testing
- Issue-Typ
- Feature
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Muss geklärt werden
- Anfängerfreundlichkeit
- 25/100