bigscience-workshop / bigscience-workshop/bigscience
How to get train-splits.txt and valid-splits.txt before training tr11-176B-ml
Dieses Issue hat noch niemand übernommen.
- Vorherrschende Sprache
- Shell
- Sterne
- 1k
- Forks
- 102
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
- Big Science version: latest
- Python version: 3.8.8
- Operating System: Ubuntu 20.04.5 LTS
Description
How to get train-splits.txt and valid-splits.txt at Line39 in train/tr11-176B-ml/tr11-176B-ml.slurm. Thx.
TRAIN_DATA_PATH=$MEGATRON_DEEPSPEED_REPO/data/train-splits.txt
VALID_DATA_PATH=$MEGATRON_DEEPSPEED_REPO/data/valid-splits.txt
Beitragsleitfaden
Erste Schritte
- Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
- Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
- Forke das Repository und arbeite in einem Branch.
- Öffne einen Pull Request, der die Issue-Nummer nennt.
Rechercherichtung
Beginne mit Zeile 39 von train/tr11-176B-ml/tr11-176B-ml.slurm und verfolge, wie TRAIN_DATA_PATH und VALID_DATA_PATH verwendet werden. Prüfe die dokumentierte Einrichtung von Training und Daten im Repository auf den Quell- oder Generierungsprozess für train-splits.txt und valid-splits.txt. Als erledigt gilt die Aufgabe, wenn die Schritte klar erklären, wie beide Dateien vor dem Ausführen von tr11-176B-ml beschafft werden.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python, shell
- Bereich
- data, devops, machine-learning
- Issue-Typ
- Dokumentation
- Schwierigkeit
- 3/5
- Geschätzter Aufwand
- 1-2 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Größtenteils klar
- Anfängerfreundlichkeit
- 28/100