bigscience-workshop / bigscience-workshop/bigscience

How to get train-splits.txt and valid-splits.txt before training tr11-176B-ml

Aperta
#66 1 commento 0 reazioni 0 assegnatari Vedi su GitHub
Lingua principale
Shell
Stelle
1k
Fork
102
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

* Big Science version: latest
* Python version: 3.8.8
* Operating System: Ubuntu 20.04.5 LTS

### Description

How to get train-splits.txt and valid-splits.txt at Line39 in [train/tr11-176B-ml/tr11-176B-ml.slurm](https://github.com/bigscience-workshop/bigscience/blob/master/train/tr11-176B-ml/tr11-176B-ml.slurm#L39
). Thx.
`TRAIN_DATA_PATH=$MEGATRON_DEEPSPEED_REPO/data/train-splits.txt`
`VALID_DATA_PATH=$MEGATRON_DEEPSPEED_REPO/data/valid-splits.txt`

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia dalla riga 39 di train/tr11-176B-ml/tr11-176B-ml.slurm e segui come vengono utilizzati TRAIN_DATA_PATH e VALID_DATA_PATH. Esamina la configurazione documentata dell’addestramento e dei dati del repository per individuare il processo di origine o generazione di train-splits.txt e valid-splits.txt. Il lavoro è completato quando i passaggi spiegano chiaramente come ottenere entrambi i file prima di eseguire tr11-176B-ml.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python, shell
Ambito
data, devops, machine-learning
Tipo di issue
Documentazione
Difficoltà
3/5
Tempo stimato
1-2 giorni
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
28/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.