Mathematical Reasoning on AMC 2023 (Score)
67.5AMC 2023 ScoreUni-DPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Uni-DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 67.5 | |
| PPO-MATH7500Model=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=†2025.06 | 67.5 | |
| SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 62.5 | |
| SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=†2025.06 | 62.5 | |
| PPOModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 62.5 | |
| Iterative DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 60 | |
| Dr. GRPO (Oat-Zero-7B)Model=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 60 | |
| RAFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 57.5 | |
| DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 57.5 | |
| SimPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 57.5 | |
| Eurus2-PRIMEModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 57.5 | |
| SimpleRL-Zero-7BModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 57.5 | |
| RAFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=†2025.06 | 55 | |
| OpenReasoner-Zero-7BModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 54.2 | |
| InstructModel=Qwen2.5-Math-7B-Instruct, Result source=*2025.06 | 50.6 | |
| BaselineModel=Qwen2.5-Math-7B, Method type=Base, Result source=-2025.06 | 47.5 | |
| BaselineModel=Qwen2.5-Math-7B, Method type=Base, Result source=†2025.06 | 47.5 | |
| GPT-4oModel=GPT-4o, Result source=*2025.06 | 45.8 | |
| Eurus2-SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 42.5 | |
| Eurus2-SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=*2025.06 | 30.1 | |
| InstructModel=Llama-3.1-70B-Instruct, Result source=*2025.06 | 30.1 |