agentscope-ai / agentscope-ai/OpenJudge

是否支持基于偏好对比损失来训练RM

Ouverte
#9 8 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Langage dominant
Python
Étoiles
830
Forks
69
Merge moyen
5 j 8 h
PR mergées (30 j)
4

Description

目前的RM偏好训练教程(examples/train/pairwise/run_pairwise.sh)中采用的是 GRPO + PPO 结合的训练方法,是否支持更直接快速的训练方法,例如直接基于偏好对比损失来优化? 如基于​Bradley-Terry loss

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Évaluation

Cette issue n'a pas encore été évaluée.

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.