OpenPipe/ART
View on GitHubAgent Reinforcement Trainer: train multi-step agents for real-world tasks using GRPO. Give your agents on-the-job training. Reinforcement learning for Qwen3.6, GPT-OSS, Llama, and more!
- Stars
- 10.8k
- Forks
- 989
- Open beginner issues
- 0
- Indexed issues
- 72
- Avg merge
- 6h 29m
- Merged PRs (30d)
- 85
- Dominant language
- Python
- License
- Apache-2.0
- Last GitHub push
- Sep 19, 2026
- Latest indexed
- Sep 20, 2026
- Contributing guide
- Contributing guide
- Code of conduct
- No code of conduct
- Beginner labels
- No beginner labels indexed
-
enhancement
Difficulty 4/5 3-5 days Newbie friendliness 48/100
-
Difficulty 5/5 Over a week Newbie friendliness 35/100
-
Difficulty 5/5 Over a week Newbie friendliness 35/100
-
Investigate output and gradient variability between matched same-source Qwen TrainerRank actors Open
Difficulty 5/5 Over a week Newbie friendliness 25/100
-
Difficulty 5/5 Over a week Newbie friendliness 20/100
-
Difficulty 5/5 Over a week Newbie friendliness 25/100
-
Difficulty 5/5 Over a week Newbie friendliness 30/100
-
Determine whether a large dynamics RL batch refusal is necessary or avoidable by execution layout Open
Difficulty 5/5 Over a week Newbie friendliness 25/100
-
Difficulty 4/5 3-5 days Newbie friendliness 48/100
-
Difficulty 5/5 Over a week Newbie friendliness 20/100
-
Difficulty 4/5 3-5 days Newbie friendliness 50/100
-
bug
Difficulty 5/5 Over a week Newbie friendliness 35/100
-
Difficulty 3/5 1-2 days Newbie friendliness 62/100
-
Difficulty 4/5 3-5 days Newbie friendliness 55/100
-
Difficulty 2/5 1-3 hours Newbie friendliness 72/100
-
auto_rl example uses Open
Difficulty 3/5 1-2 days Newbie friendliness 56/100
-
Difficulty 4/5 3-5 days Newbie friendliness 48/100
-
Difficulty 3/5 1-2 days Newbie friendliness 52/100
-
Difficulty 4/5 3-5 days Newbie friendliness 25/100
-
question
Difficulty 3/5 1-2 days Newbie friendliness 42/100
-
discussion
Difficulty 5/5 Over a week Newbie friendliness 30/100
-
W&B offline Openquestion
Difficulty 5/5 Over a week Newbie friendliness 25/100
-
bug
Difficulty 5/5 Over a week Newbie friendliness 25/100
-
bug
Difficulty 5/5 Over a week Newbie friendliness 25/100
-
bug
Difficulty 4/5 3-5 days Newbie friendliness 35/100
-
bug
Difficulty 5/5 Over a week Newbie friendliness 25/100
-
bug
Difficulty 4/5 3-5 days Newbie friendliness 35/100
-
bug
Difficulty 4/5 3-5 days Newbie friendliness 35/100
-
question
Difficulty 5/5 Over a week Newbie friendliness 25/100
-
bug
Difficulty 4/5 3-5 days Newbie friendliness 25/100
-
bug
Difficulty 4/5 3-5 days Newbie friendliness 25/100
-
Cuda out of Memory Openquestion
Difficulty 4/5 3-5 days Newbie friendliness 25/100
-
question
Difficulty 5/5 Over a week Newbie friendliness 20/100
-
bug
Difficulty 4/5 3-5 days Newbie friendliness 35/100
-
bug
Difficulty 4/5 3-5 days Newbie friendliness 25/100
-
Minio Support Openenhancement
Difficulty 3/5 1-2 days Newbie friendliness 45/100
-
Why Do Results from MCP-Trained Models Differ Greatly Between generate_benchmarks.py and train.py Openquestion
Difficulty 4/5 3-5 days Newbie friendliness 32/100
-
bug
Difficulty 4/5 3-5 days Newbie friendliness 25/100
-
bug
Difficulty 3/5 1-2 days Newbie friendliness 35/100
-
enhancement
Difficulty 3/5 1-2 days Newbie friendliness 45/100
-
bug
Difficulty 5/5 Over a week Newbie friendliness 25/100
-
bug
Difficulty 4/5 3-5 days Newbie friendliness 25/100
-
enhancement
Difficulty 4/5 3-5 days Newbie friendliness 35/100
-
About appropriate groups_per_step parameter setting given training and validation dataset volume Openquestion
Difficulty 5/5 Over a week Newbie friendliness 20/100
-
enhancement
Difficulty 4/5 3-5 days Newbie friendliness 42/100
-
question
Difficulty 4/5 3-5 days Newbie friendliness 25/100
-
bug
Difficulty 4/5 3-5 days Newbie friendliness 25/100
-
enhancement
Difficulty 4/5 3-5 days Newbie friendliness 35/100
-
enhancement
Difficulty 2/5 1-3 hours Newbie friendliness 52/100
-
enhancement
Difficulty 5/5 Over a week Newbie friendliness 25/100