InternLM / InternLM/xtuner

About RLHF need

Open
#93 3 comments 1 reaction 1 assignee Claimed by @pppppM View on GitHub
feature request good first issue
Dominant language
Python
Stars
5.2k
Forks
448
Avg merge
3d 15h
Merged PRs (30d)
26

Description

需要实现几种对齐算法
1.PPO
这个没的说,比较传统和通用,但是训练的开销会大一点
2. RAFT
LMFLOW社区有做
`https://optimalscale.github.io/LMFlow/examples/raft.html`
3.pangu-coder2
RRTF (Rank Responses to align Test&Teacher Feedback)
总结一下是说,他们是用了代码单元测试,然后把单元测试的结果作为标签合并Loss微调LLM
`https://arxiv.org/abs/2307.14936`
![image](https://github.com/InternLM/xtuner/assets/72799392/b2c57202-dbe1-4fc0-92d8-f98a21a600e3)
![image](https://github.com/InternLM/xtuner/assets/72799392/415a6720-1be1-4de3-a3c0-05f3c4ae9b9e)
RRTF华为他们这部分没有开源。RAFT是开源了,RRTF可以的话可以一起讨论一起实现一下。

Contributor guide

Open the contributing guide

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.