bigscience-workshop / bigscience-workshop/bigscience
How to get train-splits.txt and valid-splits.txt before training tr11-176B-ml
- Lingua principale
- Shell
- Stelle
- 1k
- Fork
- 102
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Descrizione
* Big Science version: latest
* Python version: 3.8.8
* Operating System: Ubuntu 20.04.5 LTS
### Description
How to get train-splits.txt and valid-splits.txt at Line39 in [train/tr11-176B-ml/tr11-176B-ml.slurm](https://github.com/bigscience-workshop/bigscience/blob/master/train/tr11-176B-ml/tr11-176B-ml.slurm#L39
). Thx.
`TRAIN_DATA_PATH=$MEGATRON_DEEPSPEED_REPO/data/train-splits.txt`
`VALID_DATA_PATH=$MEGATRON_DEEPSPEED_REPO/data/valid-splits.txt`
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Inizia dalla riga 39 di train/tr11-176B-ml/tr11-176B-ml.slurm e segui come vengono utilizzati TRAIN_DATA_PATH e VALID_DATA_PATH. Esamina la configurazione documentata dell’addestramento e dei dati del repository per individuare il processo di origine o generazione di train-splits.txt e valid-splits.txt. Il lavoro è completato quando i passaggi spiegano chiaramente come ottenere entrambi i file prima di eseguire tr11-176B-ml.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python, shell
- Ambito
- data, devops, machine-learning
- Tipo di issue
- Documentazione
- Difficoltà
- 3/5
- Tempo stimato
- 1-2 giorni
- Stato di attività
- Ferma
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 28/100