Mathematical Reasoning on OlymMATH
9.3AccuracyNExt
Evaluation Results
| Method | Links | |
|---|---|---|
| NExt#Steps=250, Backbone=Qwen2.5-14B-Instruct2026.04 | 9.3 | |
| GRPO w/ FP#Steps=250, Backbone=Qwen2.5-14B-Instruct2026.04 | 8.8 | |
| GRPO w/ FP#Steps=400, Backbone=Qwen2.5-14B-Instruct2026.04 | 8.8 | |
| GRPO w/ LoRA#Steps=400, Backbone=Qwen2.5-14B-Instruct2026.04 | 8.8 | |
| GRPO w/ LoRA#Steps=250, Backbone=Qwen2.5-14B-Instruct2026.04 | 7.8 | |
| AlphaRL#Steps=250, Backbone=Qwen2.5-14B-Instruct2026.04 | 7.8 | |
| RL-Extra#Steps=250, Backbone=Qwen2.5-14B-Instruct2026.04 | 7.6 | |
| GRPO w/ FP#Steps=400, Backbone=Qwen2.5-7B-Instruct2026.04 | 6.8 | |
| NExt#Steps=250, Backbone=Qwen2.5-7B-Instruct2026.04 | 6.5 | |
| GRPO w/ FP#Steps=250, Backbone=Qwen2.5-7B-Instruct2026.04 | 6 | |
| RL-Extra#Steps=250, Backbone=Qwen2.5-7B-Instruct2026.04 | 5.8 | |
| Backbone Model#Steps=-, Backbone=Qwen2.5-14B-Instruct2026.04 | 5.4 | |
| Backbone Model#Steps=-, Backbone=Qwen2.5-7B-Instruct2026.04 | 5.3 | |
| GRPO w/ LoRA#Steps=250, Backbone=Qwen2.5-7B-Instruct2026.04 | 5 | |
| GRPO w/ LoRA#Steps=400, Backbone=Qwen2.5-7B-Instruct2026.04 | 5 | |
| AlphaRL#Steps=250, Backbone=Qwen2.5-7B-Instruct2026.04 | 5 |