Mathematical Reasoning on MATH (Overall Score)
79.8Overall ScoreInstruct
Evaluation Results
| Method | Links | |
|---|---|---|
| InstructModel=Qwen2.5-Math-7B-Instruct, Result source=*2025.06 | 79.8 | |
| OpenReasoner-Zero-7BModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 79.2 | |
| Dr. GRPO (Oat-Zero-7B)Model=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 79 | |
| PPOModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 79 | |
| Uni-DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 78.2 | |
| RAFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 77.6 | |
| RAFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=†2025.06 | 77.6 | |
| PPO-MATH7500Model=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=†2025.06 | 77.2 | |
| SimPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 76.4 | |
| SimpleRL-Zero-7BModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 76.4 | |
| GPT-4oModel=GPT-4o, Result source=*2025.06 | 76.4 | |
| DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 75.8 | |
| Iterative DPOModel=Qwen2.5-Math-7B, Method type=Preference Alignment, Result source=-2025.06 | 75.4 | |
| Eurus2-PRIMEModel=Qwen2.5-Math-7B, Method type=Reinforcement Learning, Result source=-2025.06 | 75.4 | |
| SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 73.2 | |
| SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=†2025.06 | 73.2 | |
| BaselineModel=Qwen2.5-Math-7B, Method type=Base, Result source=-2025.06 | 65.8 | |
| BaselineModel=Qwen2.5-Math-7B, Method type=Base, Result source=†2025.06 | 65.4 | |
| Eurus2-SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=*2025.06 | 65.1 | |
| InstructModel=Llama-3.1-70B-Instruct, Result source=*2025.06 | 64.6 | |
| Eurus2-SFTModel=Qwen2.5-Math-7B, Method type=Supervised Fine-tuning, Result source=-2025.06 | 64 | |
| Qwen2.5-0.5B-InstructModel Scale=0.5B, Evaluation=0-shot2026.06 | 46 | |
| EmbedLLMModel Scale=0.5B, Evaluation=0-shot2026.06 | 44.6 | |
| DLLGModel Scale=0.5B, Evaluation=0-shot2026.06 | 43.4 | |
| Token Maj-VotingModel Scale=0.5B, Evaluation=0-shot2026.06 | 43 | |
| UniTeModel Scale=0.5B, Evaluation=0-shot2026.06 | 42.6 | |
| GaCModel Scale=0.5B, Evaluation=0-shot2026.06 | 42.4 | |
| LinearModel Scale=0.5B, Evaluation=0-shot2026.06 | 42.2 | |
| RouterDCModel Scale=0.5B, Evaluation=0-shot2026.06 | 42.2 | |
| Pack of LLMsModel Scale=0.5B, Evaluation=0-shot2026.06 | 42.2 | |
| Entropy WeightingModel Scale=0.5B, Evaluation=0-shot2026.06 | 41.8 | |
| SLERPModel Scale=0.5B, Evaluation=0-shot2026.06 | 41 | |
| Dolphin3.0-Qwen2.5-0.5BModel Scale=0.5B, Evaluation=0-shot2026.06 | 36.4 | |
| ARPipeline=Qwen3-0.6B2026.04 | 32.4 | |
| Qwen2.5-Coder-0.5B-InstructModel Scale=0.5B, Evaluation=0-shot2026.06 | 22 | |
| Task ArithmeticModel Scale=0.5B, Evaluation=0-shot2026.06 | 14.2 | |
| TIDE-CrossPipeline=Cross-Tokenizer2026.04 | 13.2 | |
| CALMPipeline=Cross-Tokenizer2026.04 | 13.14 | |
| BD3LMPipeline=Qwen3-0.6B2026.04 | 13.08 | |
| TIDE-SharedPipeline=Cross-Tokenizer2026.04 | 12.98 | |
| TIDE-SharedPipeline=Shared-Tokenizer2026.04 | 11.16 | |
| TIDE-CrossPipeline=Shared-Tokenizer2026.04 | 9.76 | |
| KLPipeline=Shared-Tokenizer2026.04 | 9.4 |