Mathematical Reasoning on Olympiad Bench (Score)
68.9ScoreICRL
Evaluation Results
| Method | Links | |
|---|---|---|
| ICRLBackbone=Qwen3-8B2026.05 | 68.9 | |
| Critique-GRPOBackbone=Qwen3-8B2026.05 | 66.2 | |
| GRPOBackbone=Qwen3-8B2026.05 | 65.6 | |
| SFTBackbone=Qwen3-8B2026.05 | 46.4 | |
| Qwen3-8BBackbone=Qwen3-8B2026.05 | 44.1 | |
| OpenReasoner-Zero-7BModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 44 | |
| GPT-4oModel=GPT-4o, Result source=*2025.06 | 43.3 | |
| Dr. GRPO (Oat-Zero-7B)Model=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 42.4 | |
| Uni-DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 41.5 | |
| PPO-MATH7500Model=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=†2025.06 | 40.7 | |
| PPOModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 40.7 | |
| InstructModel=Qwen2.5-Math-7B-Instruct, Result source=*2025.06 | 40.7 | |
| SimpleRL-Zero-7BModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 40.3 | |
| SimPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 39.3 | |
| RAFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=†2025.06 | 38.7 | |
| RAFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 38.2 | |
| DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 37.9 | |
| Iterative DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 37.9 | |
| Eurus2-PRIMEModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 37.3 | |
| SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 35.6 | |
| SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=†2025.06 | 35.6 | |
| InstructModel=Llama-3.1-70B-Instruct, Result source=*2025.06 | 31.9 | |
| Eurus2-SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=*2025.06 | 29.8 | |
| Eurus2-SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 28.7 | |
| BaselineModel=Qwen2.5-Math-7B, Method type=Base, Result source=-2025.06 | 24.3 | |
| BaselineModel=Qwen2.5-Math-7B, Method type=Base, Result source=†2025.06 | 23.4 |