Mathematical Reasoning on AIME 2024 (Pass@1, TC)
30Pass@1 AccuracyAEPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AEPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 30 | 1.2 | |
| EAPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 30 | 1 | |
| Reinforce++Backbone Model=Qwen2.5-7B-Instruct2026.06 | 26.6 | 1.1 | |
| ARPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 26.6 | 1.16 | |
| ARPOBackbone Model=Qwen2.5-3B-Instruct2026.06 | 23.3 | 1.1 | |
| EAPOBackbone Model=Qwen2.5-3B-Instruct2026.06 | 23.3 | 0.9 | |
| GRPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 23.3 | 0.93 | |
| ToolStarBackbone Model=Qwen2.5-7B-Instruct2026.06 | 23.3 | 1.86 | |
| GRPOBackbone Model=Qwen2.5-3B-Instruct2026.06 | 13.3 | 1.1 | |
| Reinforce++Backbone Model=Qwen2.5-3B-Instruct2026.06 | 13.3 | 1.21 | |
| ToolStarBackbone Model=Qwen2.5-3B-Instruct2026.06 | 13.3 | 1.03 | |
| BaseBackbone Model=Qwen2.5-7B-Instruct2026.06 | 10 | — | |
| TIRBackbone Model=Qwen2.5-3B-Instruct2026.06 | 6.7 | 0.2 | |
| TIRBackbone Model=Qwen2.5-7B-Instruct2026.06 | 6.7 | 0.2 | |
| BaseBackbone Model=Qwen2.5-3B-Instruct2026.06 | 3.3 | — |