aRustyDev / aRustyDev/ccgram

Create train/val/test splits

Aperta
#7 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
data
Lingua principale
Python
Stelle
0
Fork
0
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

## Summary
Split the normalized dataset into train, validation, and test sets with proper stratification.

## Success Criteria
- [ ] Split ratios defined (e.g., 80/10/10)
- [ ] Stratification by commit type
- [ ] No data leakage (same repo shouldn't span splits)
- [ ] Splits saved to data/splits/
- [ ] Split statistics documented
- [ ] Reproducible with fixed random seed

## Stratification Strategy
- Balance commit types across splits
- Consider stratifying by scope frequency
- Ensure test set has good coverage of rare types

## Output Files
\`\`\`
data/splits/
train.jsonl
val.jsonl
test.jsonl
splits_metadata.json
\`\`\`

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Individua l’input del dataset normalizzato e l’entry point esistente per l’elaborazione dei dati, quindi esamina come sono rappresentati i tipi di commit, l’identità del repository e la frequenza degli scope. Definisci e implementa output riproducibili di training, validation e test in data/splits/; il lavoro è completato quando esistono i tre file JSONL e splits_metadata.json, soddisfano i vincoli di stratificazione e leakage indicati e includono statistiche documentate.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python
Ambito
data, machine-learning
Tipo di issue
Funzionalità
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
38/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.