bigscience-workshop / bigscience-workshop/bigscience

How to get train-splits.txt and valid-splits.txt before training tr11-176B-ml

Offen
#66 1 Kommentar 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen

Dieses Issue hat noch niemand übernommen.

Vorherrschende Sprache
Shell
Sterne
1k
Forks
102
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

  • Big Science version: latest
  • Python version: 3.8.8
  • Operating System: Ubuntu 20.04.5 LTS
Description

How to get train-splits.txt and valid-splits.txt at Line39 in train/tr11-176B-ml/tr11-176B-ml.slurm. Thx.
TRAIN_DATA_PATH=$MEGATRON_DEEPSPEED_REPO/data/train-splits.txt
VALID_DATA_PATH=$MEGATRON_DEEPSPEED_REPO/data/valid-splits.txt

Beitragsleitfaden

Beitragsleitfaden öffnen

Erste Schritte

  1. Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
  2. Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
  3. Forke das Repository und arbeite in einem Branch.
  4. Öffne einen Pull Request, der die Issue-Nummer nennt.

Rechercherichtung

Beginne mit Zeile 39 von train/tr11-176B-ml/tr11-176B-ml.slurm und verfolge, wie TRAIN_DATA_PATH und VALID_DATA_PATH verwendet werden. Prüfe die dokumentierte Einrichtung von Training und Daten im Repository auf den Quell- oder Generierungsprozess für train-splits.txt und valid-splits.txt. Als erledigt gilt die Aufgabe, wenn die Schritte klar erklären, wie beide Dateien vor dem Ausführen von tr11-176B-ml beschafft werden.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
python, shell
Bereich
data, devops, machine-learning
Issue-Typ
Dokumentation
Schwierigkeit
3/5
Geschätzter Aufwand
1-2 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
28/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.