Mathematical Reasoning on OlympiadBench (Accuracy, Avg, Speedup)
34.69AccuracyGRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GRPOBackbone=Qwen-3-8B-Base, Method=GRPO2026.03 | 34.69 | 56.66 | — | |
| GRPO + ARROLBackbone=Qwen-3-4B-Base, Method=GRPO + ARROL2026.03 | 33.33 | 53.54 | 1.63 | |
| GRPO + ARROLBackbone=Qwen-3-8B-Base, Method=GRPO + ARROL2026.03 | 33.18 | 59.53 | 1.62 | |
| GRPOBackbone=Qwen-3-4B-Base, Method=GRPO2026.03 | 31.37 | 51.01 | — | |
| GRPO + ARROLBackbone=Qwen-3-1.7B-Base, Method=GRPO + ARROL2026.03 | 20.81 | 37.09 | 1.61 | |
| GRPOBackbone=Qwen-3-1.7B-Base, Method=GRPO2026.03 | 18.55 | 34.79 | — | |
| GRPO + ARROLBackbone=Llama-3.2-1B-Instruct, Method=GRPO + ARROL2026.03 | 4.37 | 17.49 | 1.67 | |
| GRPOBackbone=Llama-3.2-1B-Instruct, Method=GRPO2026.03 | 2.26 | 14.63 | — |