agentscope-ai / agentscope-ai/OpenJudge

奖励模型训练方式

Aberta
#17 4 comentários 0 reações 0 responsáveis Ver no GitHub
Linguagem predominante
Python
Estrelas
830
Forks
69
Merge médio
5d 8h
PRs com merge (30d)
4

Descrição

我看了咱们这个项目的RM训练方式,应该是正常大模型sft或者rl的方式,只是训练模型输出某个分数,但现在的框架例如llamafactory,openrlhf,训练奖励模型的方式其实是把大模型的隐藏层抽出来,然后添加value-head去回归分数,我想问咱们能否支持这样的方式。不知道您是否了解这两种方式的区别

Guia de contribuição

Nenhum guia de contribuição indexado para este repositório

Avaliação

Esta issue ainda não foi avaliada.

Receba novas issues na sua caixa de entrada

Um resumo curto de issues do GitHub para quem está começando.