Mathematical Reasoning on GSM-Plus
84.98AccuracyQwen3-32B
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3-32BSetting=Recur2026.06 | 84.98 | — | — | — | — | — | — | — | 2.8 | — | |
| Qwen3-14BSetting=Recur2026.06 | 84.31 | — | — | — | — | — | — | — | 0.71 | — | |
| Qwen3-14BSetting=Steer2026.06 | 84.15 | — | — | — | — | — | — | — | — | — | |
| l2-guided SelectionModel=Qwen3-14B2026.06 | 83.82 | — | — | — | — | — | — | — | 0.13 | — | |
| Qwen3-14BSetting=Base2026.06 | 83.71 | — | — | — | — | — | — | — | — | — | |
| Base (Mean@8)Model=Qwen3-14B2026.06 | 83.71 | — | — | — | — | — | — | — | — | — | |
| Qwen3-14BSetting=Base2026.06 | 83.71 | — | — | — | — | — | — | — | — | — | |
| l2-guided SelectionModel=Qwen3-32B2026.06 | 83.67 | — | — | — | — | — | — | — | 1.27 | — | |
| Qwen3-32BSetting=Steer2026.06 | 83.15 | — | — | — | — | — | — | — | — | — | |
| LRSModel=Phi-42026.06 | 82.86 | — | — | — | — | — | — | — | — | — | |
| Qwen3-32BSetting=Base2026.06 | 82.62 | — | — | — | — | — | — | — | — | — | |
| Base (Mean@8)Model=Qwen3-32B2026.06 | 82.62 | — | — | — | — | — | — | — | — | — | |
| ALRRModel=Phi-42026.06 | 82.62 | — | — | — | — | — | — | — | — | — | |
| Qwen3-32BSetting=Base2026.06 | 82.62 | — | — | — | — | — | — | — | — | — | |
| l2-guided SelectionModel=Qwen3-8B2026.06 | 82.52 | — | — | — | — | — | — | — | 1.51 | — | |
| Qwen3-8BSetting=Recur2026.06 | 82.11 | — | — | — | — | — | — | — | 1.02 | — | |
| Qwen3-8BSetting=Steer2026.06 | 81.88 | — | — | — | — | — | — | — | — | — | |
| ERSSModel=Phi-42026.06 | 81.79 | — | — | — | — | — | — | — | — | — | |
| Qwen3-8BSetting=Base2026.06 | 81.29 | — | — | — | — | — | — | — | — | — | |
| Base (Mean@8)Model=Qwen3-8B2026.06 | 81.29 | — | — | — | — | — | — | — | — | — | |
| Qwen3-8BSetting=Base2026.06 | 81.29 | — | — | — | — | — | — | — | — | — | |
| LLaMA-70BSetting=Steer2026.06 | 81.25 | — | — | — | — | — | — | — | — | — | |
| l2-guided SelectionModel=Qwen3-4B2026.06 | 81.04 | — | — | — | — | — | — | — | 1.43 | — | |
| LRSModel=Qwen3-4B2026.06 | 81.04 | — | — | — | — | — | — | — | — | — | |
| l2-guided SelectionModel=LLaMA-70B2026.06 | 80.82 | — | — | — | — | — | — | — | 1.23 | — | |
| LLaMA-70BSetting=Recur2026.06 | 80.72 | — | — | — | — | — | — | — | 1.1 | — | |
| ALRR+ERSSModel=Qwen3-4B2026.06 | 80.46 | — | — | — | — | — | — | — | — | — | |
| Base (Mean@8)Model=Qwen3-4B2026.06 | 79.9 | — | — | — | — | — | — | — | — | — | |
| ALRRModel=Qwen3-4B2026.06 | 79.88 | — | — | — | — | — | — | — | — | — | |
| Qwen3-4BSetting=Recur2026.06 | 79.88 | — | — | — | — | — | — | — | 1.01 | — | |
| LLaMA-70BSetting=Base2026.06 | 79.84 | — | — | — | — | — | — | — | — | — | |
| Base (Mean@8)Model=LLaMA-70B2026.06 | 79.84 | — | — | — | — | — | — | — | — | — | |
| LLaMA-70BSetting=Base2026.06 | 79.84 | — | — | — | — | — | — | — | — | — | |
| Qwen3-4BSetting=Steer2026.06 | 79.76 | — | — | — | — | — | — | — | — | — | |
| ERSSModel=Qwen3-4B2026.06 | 79.76 | — | — | — | — | — | — | — | — | — | |
| ALRR+LRSModel=Qwen3-4B2026.06 | 79.46 | — | — | — | — | — | — | — | — | — | |
| ERSS+LRSModel=Qwen3-4B2026.06 | 79.02 | — | — | — | — | — | — | — | — | — | |
| Qwen3-4BSetting=Base2026.06 | 78.9 | — | — | — | — | — | — | — | — | — | |
| BaselineModel=Qwen3-4B2026.06 | 78.9 | — | — | — | — | — | — | — | — | — | |
| Qwen3-4BSetting=Base2026.06 | 78.9 | — | — | — | — | — | — | — | — | — | |
| ERSSModel=Gemma3-12B-it2026.06 | 77.98 | — | — | — | — | — | — | — | — | — | |
| ALRRModel=Gemma3-12B-it2026.06 | 77.87 | — | — | — | — | — | — | — | — | — | |
| BaselineModel=Phi-42026.06 | 77.85 | — | — | — | — | — | — | — | — | — | |
| LRSModel=Gemma3-12B-it2026.06 | 77.82 | — | — | — | — | — | — | — | — | — | |
| BaselineModel=Gemma3-12B-it2026.06 | 77.8 | — | — | — | — | — | — | — | — | — | |
| l2-guided SelectionModel=Qwen3-1.7B2026.06 | 76.43 | — | — | — | — | — | — | — | 1.3 | — | |
| Qwen3-1.7BSetting=Recur2026.06 | 76.28 | — | — | — | — | — | — | — | 1.09 | — | |
| ERSSModel=Phi-4-Reasoning2026.06 | 75.66 | — | — | — | — | — | — | — | — | — | |
| Qwen3-1.7BSetting=Base2026.06 | 75.45 | — | — | — | — | — | — | — | — | — | |
| Base (Mean@8)Model=Qwen3-1.7B2026.06 | 75.45 | — | — | — | — | — | — | — | — | — | |
| Qwen3-1.7BSetting=Base2026.06 | 75.45 | — | — | — | — | — | — | — | — | — | |
| Qwen3-1.7BSetting=Steer2026.06 | 75.43 | — | — | — | — | — | — | — | — | — | |
| CoLDPolicy Model=Llama-3-70B-Instruct2025.07 | 73.8 | — | — | — | — | — | — | 202.5 | — | — | |
| ALRRModel=Phi-4-Reasoning2026.06 | 72.57 | — | — | — | — | — | — | — | — | — | |
| Loose Lips Sink ShipsPolicy Model=Llama-3-70B-Instruct2025.07 | 72.5 | — | — | — | — | — | — | 302.5 | — | — | |
| LRSModel=Phi-4-Reasoning2026.06 | 72.45 | — | — | — | — | — | — | — | — | — | |
| BaselineModel=Phi-4-Reasoning2026.06 | 72.4 | — | — | — | — | — | — | — | — | — | |
| Adaptive Length Bias MitigationPolicy Model=Llama-3-70B-Instruct2025.07 | 72.2 | — | — | — | — | — | — | 364.3 | — | — | |
| CoLD(w/o Joint)Policy Model=Llama-3-70B-Instruct2025.07 | 72.1 | — | — | — | — | — | — | 258.6 | — | — | |
| Length PenaltyPolicy Model=Llama-3-70B-Instruct2025.07 | 71.5 | — | — | — | — | — | — | 300.1 | — | — | |
| LRSModel=Gemma3-4B-it2026.06 | 71.26 | — | — | — | — | — | — | — | — | — | |
| ALRRModel=Gemma3-4B-it2026.06 | 71.16 | — | — | — | — | — | — | — | — | — | |
| Vanilla-Base-PRMPolicy Model=Llama-3-70B-Instruct2025.07 | 71 | — | — | — | — | — | — | 324.6 | — | — | |
| ERSSModel=Gemma3-4B-it2026.06 | 70.8 | — | — | — | — | — | — | — | — | — | |
| BaselineModel=Gemma3-4B-it2026.06 | 70.79 | — | — | — | — | — | — | — | — | — | |
| l2-guided SelectionModel=LLaMA-8B2026.06 | 70.57 | — | — | — | — | — | — | — | 3.86 | — | |
| LRSModel=R1-Distilled-LLaMA-8B2026.06 | 70.57 | — | — | — | — | — | — | — | — | — | |
| Uniform AveragePolicy Model=Llama-3-70B-Instruct2025.07 | 70.4 | — | — | — | — | — | — | 324.6 | — | — | |
| Locally Weighted RegressionPolicy Model=Llama-3-70B-Instruct2025.07 | 69.6 | — | — | — | — | — | — | 299.9 | — | — | |
| ALRRModel=R1-Distilled-LLaMA-8B2026.06 | 68.25 | — | — | — | — | — | — | — | — | — | |
| LLaMA-8BSetting=Recur2026.06 | 68.25 | — | — | — | — | — | — | — | 0.44 | — | |
| LLaMA-8BSetting=Base2026.06 | 67.95 | — | — | — | — | — | — | — | — | — | |
| Base (Mean@8)Model=LLaMA-8B2026.06 | 67.95 | — | — | — | — | — | — | — | — | — | |
| BaselineModel=R1-Distilled-LLaMA-8B2026.06 | 67.95 | — | — | — | — | — | — | — | — | — | |
| LLaMA-8BSetting=Base2026.06 | 67.95 | — | — | — | — | — | — | — | — | — | |
| ICaRusModel=Qwen3-8B-Base, KV Sharing=O2026.02 | 67.5 | — | — | — | — | — | — | — | — | — | |
| ALRR+LRSModel=R1-Distilled-LLaMA-8B2026.06 | 67.38 | — | — | — | — | — | — | — | — | — | |
| ALRR+ERSSModel=R1-Distilled-LLaMA-8B2026.06 | 66.86 | — | — | — | — | — | — | — | — | — | |
| LLaMA-8BSetting=Steer2026.06 | 66.43 | — | — | — | — | — | — | — | — | — | |
| ERSSModel=R1-Distilled-LLaMA-8B2026.06 | 66.43 | — | — | — | — | — | — | — | — | — | |
| Multi ModelModel=Qwen3-8B-Base, KV Sharing=X2026.02 | 66.1 | — | — | — | — | — | — | — | — | — | |
| ERSS+LRSModel=R1-Distilled-LLaMA-8B2026.06 | 65.77 | — | — | — | — | — | — | — | — | — | |
| Qwen-3Model Type=Open-weight, Number of Parameters=4B2026.03 | 64.17 | — | — | — | — | — | — | — | — | — | |
| CoLDPolicy Model=MetaMath-Mistral-7B2025.07 | 61.4 | — | — | — | — | — | — | 238.6 | — | — | |
| CoLDPolicy Model=MuggleMath-13B2025.07 | 60.3 | — | — | — | — | — | — | 243.3 | — | — | |
| Qwen-3.5Model Type=Open-weight, Number of Parameters=4B2026.03 | 60.04 | — | — | — | — | — | — | — | — | — | |
| CoLD(w/o Joint)Policy Model=MuggleMath-13B2025.07 | 59.9 | — | — | — | — | — | — | 238.3 | — | — | |
| CoLD(w/o Joint)Policy Model=MetaMath-Mistral-7B2025.07 | 59.8 | — | — | — | — | — | — | 262.7 | — | — | |
| Qwen2.5-14BRole=Teacher2026.02 | 59.7 | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-14B (Teacher)Role=Teacher, Parameters=14B2026.02 | 59.7 | — | — | — | — | — | — | — | — | — | |
| Vanilla-Base-PRMPolicy Model=MetaMath-Mistral-7B2025.07 | 59.5 | — | — | — | — | — | — | 335.5 | — | — | |
| Qwen3-8B (teacher)Role=Teacher2026.02 | 59.4 | — | — | — | — | — | — | — | — | — | |
| Length PenaltyPolicy Model=MuggleMath-13B2025.07 | 59.3 | — | — | — | — | — | — | 280.5 | — | — | |
| Length PenaltyPolicy Model=MetaMath-Mistral-7B2025.07 | 59.1 | — | — | — | — | — | — | 313.9 | — | — | |
| Vanilla-Base-PRMPolicy Model=MuggleMath-13B2025.07 | 59.1 | — | — | — | — | — | — | 287.9 | — | — | |
| Loose Lips Sink ShipsPolicy Model=MuggleMath-13B2025.07 | 59.1 | — | — | — | — | — | — | 263.9 | — | — | |
| Loose Lips Sink ShipsPolicy Model=MetaMath-Mistral-7B2025.07 | 58 | — | — | — | — | — | — | 340 | — | — | |
| χ2-DRTOBackbone=Llama3-8B2026.03 | 57.2 | — | — | — | — | — | — | — | — | — | |
| Adaptive Length Bias MitigationPolicy Model=MetaMath-Mistral-7B2025.07 | 56.5 | — | — | — | — | — | — | 385 | — | — | |
| Uniform AveragePolicy Model=MetaMath-Mistral-7B2025.07 | 56.3 | — | — | — | — | — | — | 363.8 | — | — |