allenai/reward-bench
View on GitHubRewardBench: the first evaluation tool for reward models.
- Stars
- 736
- Forks
- 99
- Open beginner issues
- 0
- Indexed issues
- 11
- Dominant language
- Python
- License
- Apache-2.0
- Last GitHub push
- Jan 31, 2026
- Latest indexed
- Sep 13, 2026
- Contributing guide
- No contributing guide
- Code of conduct
- No code of conduct
- Beginner labels
- No beginner labels indexed
- PR merge metrics
- No merged PRs in 30d
-
allenai/reward-bench#251 · 0 comments · 0 reactions · 0 assignees ·
-
allenai/reward-bench#263 · 0 comments · 0 reactions · 0 assignees ·
-
allenai/reward-bench#265 · 0 comments · 0 reactions · 0 assignees ·
-
allenai/reward-bench#267 · 0 comments · 0 reactions · 0 assignees ·
-
allenai/reward-bench#268 · 0 comments · 0 reactions · 0 assignees ·
-
allenai/reward-bench#269 · 1 comment · 0 reactions · 0 assignees ·
-
Multiple-comparison correction for per-subset comparisons (best-of-23 inflates "leads on subset X") Open
allenai/reward-bench#270 · 0 comments · 0 reactions · 0 assignees ·
-
allenai/reward-bench#272 · 0 comments · 0 reactions · 0 assignees ·
-
allenai/reward-bench#273 · 0 comments · 0 reactions · 0 assignees ·
-
allenai/reward-bench#274 · 0 comments · 0 reactions · 0 assignees ·
-
allenai/reward-bench#276 · 0 comments · 0 reactions · 0 assignees ·