Create train/val/test splits
- Lingua principale
- Python
- Stelle
- 0
- Fork
- 0
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Descrizione
## Summary
Split the normalized dataset into train, validation, and test sets with proper stratification.
## Success Criteria
- [ ] Split ratios defined (e.g., 80/10/10)
- [ ] Stratification by commit type
- [ ] No data leakage (same repo shouldn't span splits)
- [ ] Splits saved to data/splits/
- [ ] Split statistics documented
- [ ] Reproducible with fixed random seed
## Stratification Strategy
- Balance commit types across splits
- Consider stratifying by scope frequency
- Ensure test set has good coverage of rare types
## Output Files
\`\`\`
data/splits/
train.jsonl
val.jsonl
test.jsonl
splits_metadata.json
\`\`\`
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Individua l’input del dataset normalizzato e l’entry point esistente per l’elaborazione dei dati, quindi esamina come sono rappresentati i tipi di commit, l’identità del repository e la frequenza degli scope. Definisci e implementa output riproducibili di training, validation e test in data/splits/; il lavoro è completato quando esistono i tre file JSONL e splits_metadata.json, soddisfano i vincoli di stratificazione e leakage indicati e includono statistiche documentate.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python
- Ambito
- data, machine-learning
- Tipo di issue
- Funzionalità
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Stato di attività
- Ferma
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 38/100