bigscience-workshop / bigscience-workshop/evaluation
Add ANLI to Full Benchmark
Aperta
few_shot
- Lingua principale
- Python
- Stelle
- 42
- Fork
- 24
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Descrizione
use to test generalization to unseen task; maybe use FLEX?
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
L’issue nomina ANLI, FLEX e il Full Benchmark, ma non indica file né test. Inizia individuando il punto di ingresso del Full Benchmark e le integrazioni dei benchmark esistenti, quindi chiarisci se è previsto ANLI o FLEX. Il lavoro è completato quando il benchmark selezionato è incluso e la relativa valutazione della generalizzazione viene eseguita correttamente.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python
- Ambito
- machine-learning, testing
- Tipo di issue
- Funzionalità
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Stato di attività
- Ferma
- Chiarezza
- Da chiarire
- Idoneità per principianti
- 25/100