Mathematical Reasoning on Olympiad (Accuracy %)
61.2Accuracy (%)DIVER
Evaluation Results
| Method | Links | |
|---|---|---|
| DIVERBase Model=DeepSeek-R1-Distill-Qwen-7B2025.09 | 61.2 | |
| GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Reward Strategy=Clip-higher2025.09 | 59 | |
| OpenReasoner-Zero-7B @ 8kParameter size=7B, Inference budget=8k2026.02 | 47.9 | |
| OpenReasoner-Zero-7B @ 3kParameter size=7B, Inference budget=3k2026.02 | 44 | |
| DIVERBase Model=Qwen2.5-7B-Base2025.09 | 42.8 | |
| DEEP-GRPO-7BParameter size=7B2026.02 | 42.6 | |
| GPG-7BParameter size=7B2026.02 | 42.4 | |
| Oat-Zero-7B (Dr. GRPO)Parameter size=7B2026.02 | 41 | |
| PRIME-Zero-7BParameter size=7B2026.02 | 40.9 | |
| Eurus-7BParameter size=7B2026.02 | 40.9 | |
| SimpleRL-Zero-7BParameter size=7B2026.02 | 40.3 | |
| Qwen2.5-Math-1.5B-InstructParameter size=1.5B2026.02 | 40.2 | |
| GRPOBase Model=Qwen2.5-7B-Base, Reward Strategy=Clip-higher2025.09 | 39.1 | |
| Oat-Zero-1.5B (Dr. GRPO)Parameter size=1.5B2026.02 | 37.6 | |
| DEEP-GRPO-1.5BParameter size=1.5B2026.02 | 36.7 | |
| DIVERBase Model=Qwen2.5-Math-1.5B2025.09 | 33.6 | |
| GRPOBase Model=Qwen2.5-Math-1.5B, Reward Strategy=Clip-higher2025.09 | 33.4 | |
| Qwen2.5-Math-1.5BParameter size=1.5B2026.02 | 28.4 | |
| GRPOBase Model=LLaMA-3.1-8B-Instruct, Reward Strategy=Clip-higher2025.09 | 22 | |
| DIVERBase Model=LLaMA-3.1-8B-Instruct2025.09 | 21.7 | |
| Qwen2.5-Math-7BParameter size=7B2026.02 | 16.6 |