google-deepmind / google-deepmind/gemma
any RLHF reinforcement learning implementation?
Open
- Dominant language
- Python
- Stars
- 5.7k
- Forks
- 1k
- Avg merge
- 10h 33m
- Merged PRs (30d)
- 2
Description
Have you implementation reinforcement learning (RLHF) methods like GRPO and PPO?
Contributor guide
Assessment
This issue has not been assessed yet.