AlibabaResearch / AlibabaResearch/DAMO-ConvAI
Inquiry About Code Release for "Fine-Tuning Language Models with Reward Learning on Policy
Ouverte
- Langage dominant
- Python
- Étoiles
- 1.6k
- Forks
- 250
- Métriques de merge des PR
- Aucune PR mergée en 30 j
Description
I am very interested in your paper "Fine-Tuning Language Models with Reward Learning on Policy." Could you please let me know when you plan to release the code for this work?
Thank you very much!
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Évaluation
Cette issue n'a pas encore été évaluée.