deepseek-ai / deepseek-ai/DeepSeek-Math

论文里PPO的公式写错了

Open
#37 0 comments 0 reactions 0 assignees View on GitHub
Dominant language
Python
Stars
3.4k
Forks
592
PR merge metrics
No merged PRs in 30d

Description

![Image](https://github.com/user-attachments/assets/074ba875-0b08-4b69-bb6e-31dca6910a83)
应该改为:
![Image](https://github.com/user-attachments/assets/bd519992-aa88-4160-b3d3-ed07e629e7a2)

原因:因为你是对π_θ_old求的期望,你在求KL散度的时候肯定不是π_θ在分子上。另外ref模型应该是GRPO里才有的概念(用来约束当前模型和该iter开始时刻模型的更新幅度),在PPO里应该只有old模型,所以应该是π_θ_old在分子上。

可以参考InstructGPT:
![Image](https://github.com/user-attachments/assets/8bfb934b-35b8-4154-a6d1-c78b0063f721)

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.