AlibabaResearch / AlibabaResearch/DAMO-ConvAI
Inquiry About Code Release for "Fine-Tuning Language Models with Reward Learning on Policy
未关闭
- 主要语言
- Python
- 星标
- 1.6k
- 派生
- 250
- PR 合并指标
- 30 天内没有已合并 PR
描述
I am very interested in your paper "Fine-Tuning Language Models with Reward Learning on Policy." Could you please let me know when you plan to release the code for this work?
Thank you very much!
贡献指南
这个仓库没有索引到贡献指南
评估
这个 Issue 还没有评估数据。