Mathematical Reasoning on MATH-500 (Testing accuracy (%))
92.6Accuracy (MATH-500)MILES
Evaluation Results
| Method | Links | |
|---|---|---|
| MILESBackbone=GPT-4.1-mini, Inference Strategy=MILES2026.07 | 92.6 | |
| MILESBackbone=GPT-4.1, Inference Strategy=MILES2026.07 | 91.6 | |
| SCBackbone=GPT-4.1-mini, Inference Strategy=SC2026.07 | 89.4 | |
| ZS-CoTBackbone=GPT-4.1-mini, Inference Strategy=ZS-CoT2026.07 | 88 | |
| SCBackbone=GPT-4.1, Inference Strategy=SC2026.07 | 88 | |
| ZS-CoTBackbone=GPT-4.1, Inference Strategy=ZS-CoT2026.07 | 87.2 | |
| DCBackbone=GPT-4.1-mini, Inference Strategy=DC2026.07 | 87 | |
| BoTBackbone=GPT-4.1-mini, Inference Strategy=BoT2026.07 | 86.8 | |
| BoTBackbone=GPT-4.1, Inference Strategy=BoT2026.07 | 84.8 | |
| DCBackbone=GPT-4.1, Inference Strategy=DC2026.07 | 83.2 | |
| GAPGModel=Qwen2.5-1.5B2025.09 | 81.6 | |
| GeoMinBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 79.6 | |
| TraPOBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 78.2 | |
| TTRLBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 77.6 | |
| Co-rewardingBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 77.6 | |
| Self-certaintyBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 75.6 | |
| HIPPOTraining Data=DeepScaleR2026.06 | 74.6 | |
| Router-R1Model=Qwen2.5-1.5B2025.09 | 74.1 | |
| Seq-entropyBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 72.4 | |
| Full dataTraining regime=Full dataset2026.05 | 72.2 | |
| RFGOOptimization=Reasoning Feature-Guided Optimization2026.05 | 72 | |
| Tok-entropyBackbone=Deepseek-R1-Distill-Qwen-1.5B, Supervision Setting=semi-supervised (10% labeled data), Domain Context=In-Domain2026.06 | 70.2 | |
| GAPGModel=LLaMA-3.2-3B2025.09 | 68.6 | |
| AugHard@8Training regime=Rewritten AugHard@8 subset2026.05 | 68.4 | |
| hard@8Training regime=hard@8 subset2026.05 | 65 | |
| Router-R1Model=LLaMA-3.2-3B2025.09 | 64.9 | |
| Qwen3-4B + SFTTraining Data=DeepScaleR2026.06 | 60.2 | |
| AutoMixModel=Qwen2.5-1.5B2025.09 | 57.2 | |
| ZO Fine-tunerBackbone=Qwen2.5-14B, Fine-tuning dataset=MetaMathQA2025.10 | 54.6 | |
| MeZOBackbone=Qwen2.5-14B, Fine-tuning dataset=MetaMathQA2025.10 | 53 | |
| Qwen3-4BTraining Data=DeepScaleR2026.06 | 49.6 | |
| AutoMixModel=LLaMA-3.2-3B2025.09 | 47.9 | |
| Base ModelBackbone=Qwen2.5-14B2025.10 | 43.2 |