Mathematical Reasoning on AIME 2024 (Raw Score)
36.7Raw ScorePPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PPOModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 36.7 | |
| Dr. GRPO (Oat-Zero-7B)Model=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 33.3 | |
| PPO-MATH7500Model=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=†2025.06 | 33.3 | |
| Iterative DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 30 | |
| DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 26.7 | |
| SimPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 26.7 | |
| Uni-DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 26.7 | |
| SimpleRL-Zero-7BModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 26.7 | |
| BaselineModel=Qwen2.5-Math-7B, Method type=Base, Result source=-2025.06 | 23.3 | |
| BaselineModel=Qwen2.5-Math-7B, Method type=Base, Result source=†2025.06 | 23.3 | |
| Eurus2-PRIMEModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 23.3 | |
| SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 20 | |
| SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=†2025.06 | 20 | |
| RAFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 20 | |
| RAFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=†2025.06 | 20 | |
| InstructModel=Llama-3.1-70B-Instruct, Result source=*2025.06 | 16.7 | |
| OpenReasoner-Zero-7BModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 13.3 | |
| InstructModel=Qwen2.5-Math-7B-Instruct, Result source=*2025.06 | 13.3 | |
| GPT-4oModel=GPT-4o, Result source=*2025.06 | 9.3 | |
| Eurus2-SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 3.3 | |
| Eurus2-SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=*2025.06 | 3.3 |