Mathematical Reasoning on MATH 500 (pass@1, pass@3, Time)
96Pass@1 RateQwen3
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Qwen3Model Category=Original Models2026.05 | 96 | — | — | — | — | — | |
| OpenThoughtModel Family=Qwen3.5, Model Size=9B2026.05 | 92 | 97.6 | — | — | — | — | |
| MINDLOOMModel Family=Qwen3.5, Model Size=9B2026.05 | 91.8 | 98.2 | — | — | — | — | |
| MegaScienceModel Family=Qwen3.5, Model Size=9B2026.05 | 91.2 | 96.2 | — | — | — | — | |
| DS-V3.2 DistillModel Family=Qwen3.5, Model Size=9B2026.05 | 90.8 | 97.2 | — | — | — | — | |
| Scaf-GRPOFramework=GRPO2026.06 | 90.4 | — | — | — | — | — | |
| OpenThoughtModel Family=Qwen3.5, Model Size=4B2026.05 | 90.2 | 96.6 | — | — | — | — | |
| MixedFramework=TD-Grokking2026.06 | 90.2 | — | — | — | — | — | |
| DynamicFramework=TD-Grokking2026.06 | 90 | — | — | — | — | — | |
| Claude-4.5-haikuStudent Model=-, Teacher Model=Claude-4.5-haiku, Method=Base2026.05 | 89.95 | — | — | — | — | — | |
| MINDLOOMModel Family=Qwen3.5, Model Size=4B2026.05 | 89.8 | 96.4 | — | — | — | — | |
| VanillaFramework=GRPO2026.06 | 89.8 | — | — | — | — | — | |
| AblationFramework=GRPO2026.06 | 89.6 | — | — | — | — | — | |
| BaseModel Family=Qwen3.5, Model Size=9B2026.05 | 89.2 | 96.8 | — | — | — | — | |
| QuestAFramework=GRPO2026.06 | 89 | — | — | — | — | — | |
| Base2026.06 | 88.8 | — | — | — | — | — | |
| SSR-Fast-2Decoding Strategy=Fast Mode 2, N (paths)=5, Threshold=72025.05 | 88.67 | 92 | 47.63 | — | — | — | |
| SSR (Full)Decoding Strategy=Full, N (paths)=5, Threshold=72025.05 | 88.67 | 92 | 67.07 | — | — | — | |
| SFTFramework=GRPO2026.06 | 88.6 | — | — | — | — | — | |
| OpenThoughtModel Family=Qwen3-2507, Model Size=8B2026.05 | 87.8 | 97.2 | — | — | — | — | |
| BaseModel Family=Qwen3.5, Model Size=4B2026.05 | 87.8 | 94.6 | — | — | — | — | |
| SSR-Fast-1Decoding Strategy=Fast Mode 1, N (paths)=5, Threshold=72025.05 | 87.78 | 91 | 36.82 | — | — | — | |
| DS-V3.2 DistillModel Family=Qwen3.5, Model Size=4B2026.05 | 87.6 | 96.5 | — | — | — | — | |
| Sub-onlyFramework=TD-Grokking2026.06 | 87.6 | — | — | — | — | — | |
| baseline2025.05 | 87.33 | 92 | 69.82 | — | — | — | |
| MegaScienceModel Family=Qwen3.5, Model Size=4B2026.05 | 87 | 95.4 | — | — | — | — | |
| Gemini-2.5-flashStudent Model=-, Teacher Model=Gemini-2.5-flash, Method=Base2026.05 | 86.83 | — | — | — | — | — | |
| MINDLOOMModel Family=Qwen3-2507, Model Size=8B2026.05 | 86.8 | 97.4 | — | — | — | — | |
| ExTraBackbone=Nemontron-1.5B2026.06 | 86.5 | — | — | — | — | 96.6 | |
| GRPO-1.5BZero-shot=true, Model Category=Qwen 1.5B Models, Training Samples=7,0002025.05 | 86.2 | — | — | — | — | — | |
| Qwen3-8192Model Category=Original Models, Max Generation Length=81922026.05 | 86.2 | — | — | — | — | — | |
| DAPOBackbone=Nemontron-1.5B2026.06 | 86.2 | — | — | — | — | 96 | |
| AAPO-1.5BZero-shot=true, Model Category=Qwen 1.5B Models, Training Samples=7,0002025.05 | 86 | — | — | — | — | — | |
| GRPOBackbone=Nemontron-1.5B2026.06 | 85.9 | — | — | — | — | 95.6 | |
| DAPO + PIPOModel=Qwen3-8B-Base2026.04 | 85.7 | — | — | — | — | — | |
| Still-3-1.5B-PreviewZero-shot=true, Model Category=Qwen 1.5B Models, Training Samples=30K2025.05 | 85.5 | — | — | — | — | — | |
| GRPO + PIPOModel=Qwen3-8B-Base2026.04 | 85.3 | — | — | — | — | — | |
| OpenThoughtModel Family=Qwen3-2507, Model Size=4B2026.05 | 85.2 | 94 | — | — | — | — | |
| MINDLOOMModel Family=Qwen3-2507, Model Size=4B2026.05 | 85.2 | 98.6 | — | — | — | — | |
| MegaScienceModel Family=Qwen3-2507, Model Size=8B2026.05 | 85.2 | 93.2 | — | — | — | — | |
| OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B, Method=OPD2026.05 | 84.82 | — | — | — | — | — | |
| OmniOPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B, Method=OmniOPD2026.05 | 84.61 | — | — | — | — | — | |
| InstructFine-tuning base=Qwen2.5-Math-7B, Comparison Group=Non-comparable Baselines2025.08 | 84.6 | — | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-1.5BZero-shot=true, Model Category=Qwen 1.5B Models, Training Samples=–2025.05 | 84.4 | — | — | — | — | — | |
| TGPO-annealingModel Category=On-Policy Methods2026.05 | 84.4 | — | — | — | — | — | |
| BaseModel Family=Qwen3-2507, Model Size=4B2026.05 | 84.4 | 90.2 | — | — | — | — | |
| DS-V3.2 DistillModel Family=Qwen3-2507, Model Size=8B2026.05 | 84.4 | 93 | — | — | — | — | |
| GRPOModel=Qwen3-8B-Base2026.04 | 84.3 | — | — | — | — | — | |
| TGPORModel Category=On-Policy Methods2026.05 | 84.2 | — | — | — | — | — | |
| DAPOModel=Qwen3-8B-Base2026.04 | 84.1 | — | — | — | — | — | |
| MegaScienceModel Family=Qwen3-2507, Model Size=4B2026.05 | 83.8 | 91.4 | — | — | — | — | |
| LUFFYModel Category=Off-Policy and Mixed-Policy2026.05 | 83.6 | — | — | — | — | — | |
| KDRLModel Category=On-Policy Methods2026.05 | 83.6 | — | — | — | — | — | |
| TGPOModel Category=On-Policy Methods2026.05 | 83.6 | — | — | — | — | — | |
| GSPO + PIPOModel=Qwen3-8B-Base2026.04 | 83.5 | — | — | — | — | — | |
| GPG-1.5BZero-shot=true, Model Category=Qwen 1.5B Models, Training Samples=7,0002025.05 | 83.4 | — | — | — | — | — | |
| OmniOPDStudent Model=Qwen3-4B, Teacher Model=Gemini-2.5-flash, Method=OmniOPD2026.05 | 83.3 | — | — | — | — | — | |
| DAPO + PIPOModel=Qwen3-4B-Base2026.04 | 82.7 | — | — | — | — | — | |
| DAPOModel=Qwen3-4B-Base2026.04 | 82.5 | — | — | — | — | — | |
| AAPO-7BZero-shot=true, Model Category=Qwen 7B Models, Training Samples=8,5232025.05 | 82.4 | — | — | — | — | — | |
| BaseModel Family=Qwen3-2507, Model Size=8B2026.05 | 82.4 | 91 | — | — | — | — | |
| GRPO++Model Category=On-Policy Methods2026.05 | 82.2 | — | — | — | — | — | |
| Eurus-2-7B-PRIMEZero-shot=true, Model Category=Qwen 7B Models, Training Samples=230K + 150K2025.05 | 81.8 | — | — | — | — | — | |
| GRPO + PIPOModel=Qwen3-4B-Base2026.04 | 81.7 | — | — | — | — | — | |
| GSPO + PIPOModel=Qwen3-4B-Base2026.04 | 81.7 | — | — | — | — | — | |
| GSPOModel=Qwen3-8B-Base2026.04 | 81.7 | — | — | — | — | — | |
| ReLIFTFine-tuning base=Qwen2.5-Math-7B, Comparison Group=Non-comparable Baselines2025.08 | 81.4 | — | — | — | — | — | |
| PRIME-ZeroModel Category=On-Policy Methods2026.05 | 81.4 | — | — | — | — | — | |
| OmniOPDStudent Model=Qwen3-4B, Teacher Model=Claude-4.5-haiku, Method=OmniOPD2026.05 | 81.28 | — | — | — | — | — | |
| Oat-Zero-7BZero-shot=true, Model Category=Qwen 7B Models, Training Samples=8,5232025.05 | 81.2 | — | — | — | — | — | |
| DS-V3.2 DistillModel Family=Qwen3-2507, Model Size=4B2026.05 | 81.2 | 91.6 | — | — | — | — | |
| OpenReasoner-Zero-7BZero-shot=true, Model Category=Qwen 7B Models, Training Samples=57K2025.05 | 80.8 | — | — | — | — | — | |
| LUFFYFine-tuning base=Qwen2.5-Math-7B, Comparison Group=Non-comparable Baselines2025.08 | 80.6 | — | — | — | — | — | |
| SFTStudent Model=Qwen3-4B, Teacher Model=Claude-4.5-haiku, Method=SFT2026.05 | 80.56 | — | — | — | — | — | |
| SFTModel Category=Off-Policy and Mixed-Policy2026.05 | 80.4 | — | — | — | — | — | |
| Qwen3-1.7B (GRPO)Student Model=Qwen3-1.7B, Teacher Model=-, Method=GRPO2026.05 | 80.35 | — | — | — | — | — | |
| GPG-7BZero-shot=true, Model Category=Qwen 7B Models, Training Samples=8,5232025.05 | 80.2 | — | — | — | — | — | |
| SFTStudent Model=Qwen3-4B, Teacher Model=Gemini-2.5-flash, Method=SFT2026.05 | 80.1 | — | — | — | — | — | |
| SFTStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B, Method=SFT2026.05 | 79.91 | — | — | — | — | — | |
| GRPOModel=Qwen3-4B-Base2026.04 | 79.5 | — | — | — | — | — | |
| GSPOModel=Qwen3-4B-Base2026.04 | 79.5 | — | — | — | — | — | |
| GRPO (MATH)Backbone=Qwen2.5-Math-7B, Note=RL upper bound reference2026.06 | 78.5 | — | — | — | — | — | |
| rStarFine-tuning base=Qwen2.5-Math-7B, Comparison Group=Non-comparable Baselines2025.08 | 78.4 | — | — | — | — | — | |
| spec-reason (9)Threshold=92025.05 | 78 | 90 | 44.33 | — | — | — | |
| Oat-ZeroModel Category=On-Policy Methods2026.05 | 78 | — | — | — | — | — | |
| Simple-RLFine-tuning base=Qwen2.5-Math-7B, Comparison Group=Comparable Baselines (zero setting or less expert data)2025.08 | 77.8 | — | — | — | — | — | |
| SimpleRL-Zero-7BZero-shot=true, Model Category=Qwen 7B Models, Training Samples=8,5232025.05 | 77.4 | — | — | — | — | — | |
| spec-reason (7)Threshold=72025.05 | 76 | 88 | 19.47 | — | — | — | |
| DPO-VPFine-tuning base=Qwen2.5-Math-7B, Comparison Group=Comparable Baselines (zero setting or less expert data)2025.08 | 76 | — | — | — | — | — | |
| SimpleRL-ZeroModel Category=On-Policy Methods2026.05 | 76 | — | — | — | — | — | |
| Scalable PSBackbone=Qwen2.5-Math-7B2026.06 | 75.8 | — | — | — | — | — | |
| EGPSGBackbone=Qwen2.5-Math-7B, Variant=MTM2026.06 | 75.8 | — | — | — | — | — | |
| DPO-LoRRFine-tuning base=Qwen2.5-Math-7B, Iteration=iter32025.08 | 75.6 | — | — | — | — | — | |
| DPO-R1Fine-tuning base=Qwen2.5-Math-7B, Comparison Group=Comparable Baselines (zero setting or less expert data)2025.08 | 75.4 | — | — | — | — | — | |
| DPO-LoRRFine-tuning base=Qwen2.5-Math-7B, Iteration=iter22025.08 | 75.4 | — | — | — | — | — | |
| EGPSLBackbone=Qwen2.5-Math-7B, Variant=MTM2026.06 | 75.4 | — | — | — | — | — | |
| OmniOPDStudent Model=Qwen3-4B, Teacher Model=Qwen3-30B-A3B-Inst., Method=OmniOPD2026.05 | 74.98 | — | — | — | — | — | |
| MH Power SamplingBackbone=Qwen2.5-Math-7B2026.06 | 74.8 | — | — | — | — | — | |
| FPABackbone=Qwen3-4B-Base2025.09 | 74.5 | — | — | — | — | — | |
| APPS (p-only)Backbone=Qwen2.5-Math-7B2026.06 | 74.4 | — | — | — | — | — |