Mathematical Reasoning on AIME'25 (accuracy %)
75.83AIME'25 AccuracyMOPD
Evaluation Results
| Method | Links | |
|---|---|---|
| MOPDinference_mode=thinking mode2026.06 | 75.83 | |
| Teacher Bestinference_mode=thinking mode2026.06 | 75.42 | |
| NebulaExp-reasoning-SFTBackbone=Qwen3-8B-base2026.06 | 72.08 | |
| Base (SFT)inference_mode=thinking mode2026.06 | 70.83 | |
| Qwen3-14BBackbone=Qwen3-14B2026.06 | 70.4 | |
| QWQ-32BBackbone=QWQ-32B2026.06 | 69.5 | |
| Qwen3-8B-thinkingBackbone=Qwen3-8B, Mode=thinking2026.06 | 65.71 | |
| Qwen3-8Binference_mode=thinking mode2026.06 | 65.71 | |
| LaPha / sg@128Base model=Qwen2.5-7B, Tool=✓2026.02 | 53.3 | |
| LaPha / sg@128Base model=Qwen2.5-Math-7B, Tool=✓2026.02 | 53.3 | |
| GPT-o1-miniTool=✗2026.02 | 51.7 | |
| LaPha / sg@128Base model=Qwen2.5-Math-1.5B, Tool=✓2026.02 | 43.3 | |
| ToRLBase model=Qwen2.5-Math-7B, Tool=✓2026.02 | 30 | |
| ToRLBase model=Qwen2.5-Math-1.5B, Tool=✓2026.02 | 26.7 | |
| LaPhaBase model=Qwen2.5-Math-1.5B, Tool=✓2026.02 | 26.7 | |
| DAPOBase model=Qwen2.5-Math-7B, Tool=✗2026.02 | 23.3 | |
| LaPha / sg@128Base model=Qwen2.5-1.5B, Tool=✓2026.02 | 16.7 | |
| DAPOBase model=Qwen2.5-7B, Tool=✗2026.02 | 16.7 | |
| SFTBase model=Qwen2.5-Math-7B, Tool=✗2026.02 | 16.7 | |
| SFTBase model=Qwen2.5-Math-7B, Tool=✓2026.02 | 16.7 | |
| DAPOBase model=Qwen2.5-Math-1.5B, Tool=✗2026.02 | 14.4 | |
| SFTBase model=Qwen2.5-Math-1.5B, Tool=✓2026.02 | 13.3 | |
| PrimeBase model=Qwen2.5-Math-7B, Tool=✗2026.02 | 13.3 | |
| LaPhaBase model=Qwen2.5-1.5B, Tool=✓2026.02 | 10.4 | |
| SFTBase model=Qwen2.5-Math-1.5B, Tool=✗2026.02 | 10 | |
| DAPOBase model=Qwen2.5-1.5B, Tool=✗2026.02 | 6.7 | |
| SFTBase model=Qwen2.5-7B, Tool=✗2026.02 | 6.7 | |
| SimpleRLBase model=Qwen2.5-Math-7B, Tool=✗2026.02 | 6.7 | |
| GPT-4oTool=✗2026.02 | 5.8 | |
| SFTBase model=Qwen2.5-1.5B, Tool=✗2026.02 | 0.4 |