Mathematical Reasoning on AIME 2025 (Pass@1, TC)
30Pass@1ARPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ARPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 30 | 1.03 | |
| EAPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 26.6 | 0.93 | |
| GRPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 23.3 | 0.83 | |
| Reinforce++Backbone Model=Qwen2.5-7B-Instruct2026.06 | 23.3 | 1.03 | |
| AEPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 23.3 | 1.21 | |
| ToolStarBackbone Model=Qwen2.5-7B-Instruct2026.06 | 20 | 1.4 | |
| Reinforce++Backbone Model=Qwen2.5-3B-Instruct2026.06 | 16.7 | 1.3 | |
| ARPOBackbone Model=Qwen2.5-3B-Instruct2026.06 | 16.7 | 1.3 | |
| GRPOBackbone Model=Qwen2.5-3B-Instruct2026.06 | 13.3 | 1.22 | |
| ToolStarBackbone Model=Qwen2.5-3B-Instruct2026.06 | 13.3 | 1.11 | |
| EAPOBackbone Model=Qwen2.5-3B-Instruct2026.06 | 13.3 | 0.89 | |
| BaseBackbone Model=Qwen2.5-7B-Instruct2026.06 | 10 | — | |
| TIRBackbone Model=Qwen2.5-7B-Instruct2026.06 | 10 | 0.16 | |
| BaseBackbone Model=Qwen2.5-3B-Instruct2026.06 | 6.7 | — | |
| TIRBackbone Model=Qwen2.5-3B-Instruct2026.06 | 6.7 | 0.2 |