Mathematical Reasoning on AIME 2024-2025 (pass@1, pass@256)
6.3Pass@1GRPO + Branch
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO + BranchBackbone=Qwen2.5-Math-7B-Base, Framework=SAGE2026.05 | 6.3 | 42.7 | |
| GRPO + Forward KLBackbone=Qwen2.5-Math-7B-Base, Training=RLVR2026.05 | 5.7 | 43.3 | |
| GRPO + TokenBackbone=Qwen2.5-Math-7B-Base, Framework=SAGE2026.05 | 5.7 | 42.7 | |
| GRPOBackbone=Qwen2.5-Math-7B-Base, Training=RLVR2026.05 | 5.3 | 40.7 | |
| GRPO + RandomBackbone=Qwen2.5-Math-7B-Base, Framework=SAGE2026.05 | 5 | 42 | |
| GRPO w/o KLBackbone=Qwen2.5-Math-7B-Base, Training=RLVR2026.05 | 4.3 | 41 | |
| Base ModelBackbone=Qwen2.5-Math-7B-Base, Training=SFT-only2026.05 | 3.3 | 39.3 |