agentscope-ai / agentscope-ai/OpenJudge

是否支持基于偏好对比损失来训练RM

Aperta
#9 8 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Lingua principale
Python
Stelle
830
Fork
69
Merge medio
5g 8h
PR unite (30g)
4

Descrizione

目前的RM偏好训练教程(examples/train/pairwise/run_pairwise.sh)中采用的是 GRPO + PPO 结合的训练方法,是否支持更直接快速的训练方法,例如直接基于偏好对比损失来优化? 如基于​Bradley-Terry loss

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Valutazione

Questa issue non è ancora stata valutata.

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.