AlibabaResearch / AlibabaResearch/DAMO-ConvAI
Inquiry About Code Release for "Fine-Tuning Language Models with Reward Learning on Policy
Offen
- Vorherrschende Sprache
- Python
- Sterne
- 1.6k
- Forks
- 250
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
I am very interested in your paper "Fine-Tuning Language Models with Reward Learning on Policy." Could you please let me know when you plan to release the code for this work?
Thank you very much!
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Bewertung
Dieses Issue wurde noch nicht bewertet.