AlibabaResearch / AlibabaResearch/DAMO-ConvAI

Inquiry About Code Release for "Fine-Tuning Language Models with Reward Learning on Policy

オープン
#154 コメント 0 件 リアクション 0 件 担当者 0 名 GitHub で見る
主要言語
Python
スター
1.6k
フォーク
250
PR マージ指標
30日以内にマージされた PR はありません

説明

I am very interested in your paper "Fine-Tuning Language Models with Reward Learning on Policy." Could you please let me know when you plan to release the code for this work?

Thank you very much!

コントリビューションガイド

このリポジトリのコントリビューションガイドは索引されていません

評価

この issue はまだ評価されていません。

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。