Mathematical Reasoning on Minervamath
34.19AccuracyGRPO + ARROL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GRPO + ARROLBackbone=Qwen-3-8B-Base, Method=GRPO + ARROL2026.03 | 34.19 | 1.62 | 59.53 | |
| GRPOBackbone=Qwen-3-8B-Base, Method=GRPO2026.03 | 32.36 | — | 56.66 | |
| NumcaBase Model=Qwen2.5-Math-1.5B-Instruct, RL Algorithm=GRPO, Credit Assignment Method=Numca2026.05 | 31.3 | — | — | |
| GRPOBackbone=Qwen-3-4B-Base, Method=GRPO2026.03 | 30.88 | — | 51.01 | |
| GRPOBase Model=Qwen2.5-Math-1.5B-Instruct, RL Algorithm=GRPO2026.05 | 30.1 | — | — | |
| GRPO + ARROLBackbone=Qwen-3-4B-Base, Method=GRPO + ARROL2026.03 | 28.67 | 1.63 | 53.54 | |
| Qwen2.5-Math-1.5B-InstructBase Model=Qwen2.5-Math-1.5B-Instruct2026.05 | 28.6 | — | — | |
| DAPOModel=Qwen-3-1.7B-Base2026.03 | 20.96 | — | — | |
| ARROLModel=Qwen-3-1.7B-Base, Base Method=DAPO2026.03 | 20.96 | 1.7 | — | |
| GRPOBackbone=Qwen-3-1.7B-Base, Method=GRPO2026.03 | 17.65 | — | 34.79 | |
| GRPO + ARROLBackbone=Qwen-3-1.7B-Base, Method=GRPO + ARROL2026.03 | 16.91 | 1.61 | 37.09 | |
| GRPO + ARROLBackbone=Llama-3.2-1B-Instruct, Method=GRPO + ARROL2026.03 | 4.04 | 1.67 | 17.49 | |
| GRPOBackbone=Llama-3.2-1B-Instruct, Method=GRPO2026.03 | 3.31 | — | 14.63 |