Mathematical Reasoning on Aggregate Mathematical Tasks (AIME24/25, AMC23, Minerva, OlymMATH)
28.3Average ScoreNExt
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| NExt#Steps=250, Backbone=Qwen2.5-14B-Instruct2026.04 | 28.3 | 33.3 | |
| GRPO w/ FP#Steps=400, Backbone=Qwen2.5-14B-Instruct2026.04 | 27.7 | 58 | |
| GRPO w/ LoRA#Steps=400, Backbone=Qwen2.5-14B-Instruct2026.04 | 27 | 64.5 | |
| GRPO w/ FP#Steps=250, Backbone=Qwen2.5-14B-Instruct2026.04 | 26.3 | 45.5 | |
| RL-Extra#Steps=250, Backbone=Qwen2.5-14B-Instruct2026.04 | 26.2 | 46.3 | |
| GRPO w/ LoRA#Steps=250, Backbone=Qwen2.5-14B-Instruct2026.04 | 25.8 | 50 | |
| AlphaRL#Steps=250, Backbone=Qwen2.5-14B-Instruct2026.04 | 25 | 59.5 | |
| NExt#Steps=250, Backbone=Qwen2.5-7B-Instruct2026.04 | 24.2 | 49 | |
| GRPO w/ FP#Steps=400, Backbone=Qwen2.5-7B-Instruct2026.04 | 24 | 81.6 | |
| GRPO w/ LoRA#Steps=400, Backbone=Qwen2.5-7B-Instruct2026.04 | 23.5 | 90.9 | |
| GRPO w/ FP#Steps=250, Backbone=Qwen2.5-7B-Instruct2026.04 | 23.1 | 62.5 | |
| RL-Extra#Steps=250, Backbone=Qwen2.5-7B-Instruct2026.04 | 22.7 | 69.4 | |
| GRPO w/ LoRA#Steps=250, Backbone=Qwen2.5-7B-Instruct2026.04 | 22.1 | 83.3 | |
| AlphaRL#Steps=250, Backbone=Qwen2.5-7B-Instruct2026.04 | 21.6 | 100 | |
| Backbone Model#Steps=-, Backbone=Qwen2.5-14B-Instruct2026.04 | 20.8 | — | |
| Backbone Model#Steps=-, Backbone=Qwen2.5-7B-Instruct2026.04 | 19.1 | — |