Reproduction of Olmo3
Offen
- Vorherrschende Sprache
- Python
- Sterne
- 395
- Forks
- 105
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
Hi Dear Author,
I'm trying to reproduce Olmo3's result, but for intermediate checkpoints, whenever I wanted to eval on mmlu(mmlu:cot::olmo3:midtrain), it seems the memory just gradually increases until OOM, seems the COT is too long?
the model I was trying to reproduce is: https://huggingface.co/allenai/Olmo-3-7B-Think-SFT
Much appreciated!
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Bewertung
Dieses Issue wurde noch nicht bewertet.