Mathematical Reasoning on SVAMP
97AccuracyGPT-4o + QuaSAR
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GPT-4o + QuaSARBackbone=GPT-4o, Prompting Strategy=QuaSAR2025.02 | 97 | — | — | — | — | |
| GoAgent2026.03 | 96.46 | — | — | — | — | |
| CoFiCotBackbone=Qwen2.5-Math-7B2026.03 | 95.8 | — | — | — | — | |
| ARG-Designer2026.03 | 95.63 | — | — | — | — | |
| k-way SCBackbone=Qwen2.5-Math-7B, k=402026.03 | 95.5 | — | — | — | — | |
| k-way SCBackbone=Qwen2.5-Math-7B, k=1202026.03 | 95.4 | — | — | — | — | |
| GPT-4o + FCoTBackbone=GPT-4o, Prompting Strategy=FCoT2025.02 | 95.3 | — | — | — | — | |
| GPT-4Protocol=PAL, Setting=Tool manipulation2024.05 | 94.8 | — | — | — | — | |
| GPT-4 (Code Interpreter)Decoding Strategy=Greedy2024.02 | 94.8 | — | — | — | — | |
| EIB-LEARNER2026.03 | 94.7 | — | — | — | — | |
| Teaching-Inspired Integrated Prompting FrameworkModel=GPT-42024.10 | 93.9 | — | — | — | — | |
| Previous SoTA2024.10 | 93.7 | — | — | — | — | |
| COMT+CCRLModel=QWEN3-4B, Method=COMT+CCRL2026.01 | 93.4 | — | — | — | — | |
| Best-of-kBackbone=Qwen2.5-Math-7B, k=1202026.03 | 93.4 | — | — | — | — | |
| Base ModelBackbone=Qwen3-1.7B2026.02 | 93.3 | — | — | 608 | — | |
| BiRouterDyn.=true, Dis.=true2025.11 | 93.2 | — | — | — | — | |
| QWEN3-8BModel=QWEN3-8B, Method=FEW-SHOT2026.01 | 93.1 | — | — | — | — | |
| G-Designer2026.03 | 93.1 | — | — | — | — | |
| Extra-CoTBackbone=Qwen3-1.7B, Ratio=1.02026.02 | 93 | — | — | 656 | 107 | |
| Extra-CoTBackbone=Qwen3-1.7B, Ratio=0.82026.02 | 93 | — | — | 612 | 100 | |
| Extra-CoTBackbone=Qwen3-1.7B, Ratio=0.62026.02 | 93 | — | — | 473 | 78 | |
| GPT-42024.05 | 92.9 | — | — | — | — | |
| CoTModel=GPT-42024.10 | 92.6 | — | — | — | — | |
| COMTModel=QWEN3-4B, Method=COMT2026.01 | 92.4 | — | — | — | — | |
| QWEN2.5-7BModel=QWEN2.5-7B, Method=FEW-SHOT2026.01 | 92.2 | — | — | — | — | |
| GPT-4 + PHPPHP=true, Prompting Strategy=Complex CoT, Decoding Strategy=greedy2023.04 | 91.9 | 2.07 | — | — | — | |
| Extra-CoT (CHRPO)Backbone=Qwen3-1.7B, Ratio=<POLICY>2026.02 | 91.8 | — | — | 127 | 21 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B2026.03 | 91.8 | — | — | — | — | |
| LLM-DebateDyn.=false, Dis.=false2025.11 | 91.76 | — | — | — | — | |
| QWEN3-4BModel=QWEN3-4B, Method=FEW-SHOT2026.01 | 91.6 | — | — | — | — | |
| AgentDropout2026.03 | 91.04 | — | — | — | — | |
| AgentPrune2026.03 | 90.58 | — | — | — | — | |
| ComplexCoT2025.11 | 90.53 | — | — | — | — | |
| GPT-4PHP=false, Prompting Strategy=Complex CoT, Decoding Strategy=greedy2023.04 | 90.5 | — | — | — | — | |
| COMT+CCRLModel=QWEN2.5-7B, Method=COMT+CCRL2026.01 | 90.5 | — | — | — | — | |
| GPT-4oBackbone=GPT-4o, Prompting Strategy=Zero-shot2025.02 | 90.4 | — | — | — | — | |
| JiuZhang3.0-7BModel Scale=7B, Backbone=Mistral-7B2024.05 | 90.4 | — | — | — | — | |
| COT-SFT+RLModel=QWEN2.5-7B, Method=COT-SFT+RL2026.01 | 90.4 | — | — | — | — | |
| GPT-4o + CoTBackbone=GPT-4o, Prompting Strategy=CoT2025.02 | 90.3 | — | — | — | — | |
| MAmmoTH2-7B-PlusModel Scale=7B2024.05 | 90.3 | — | — | — | — | |
| COMT+CCRLModel=QWEN3-8B, Method=COMT+CCRL2026.01 | 90.3 | — | — | — | — | |
| TokenSkipBackbone=Qwen3-1.7B, Ratio=0.82026.02 | 90.3 | — | — | 541 | 89 | |
| G-DesignerDyn.=false, Dis.=false2025.11 | 90.29 | — | — | — | — | |
| JiuZhang3.0-8x7BModel Scale=8x7B2024.05 | 90.2 | — | — | — | — | |
| LLM-Debate2026.03 | 90.11 | — | — | — | — | |
| MAmmoTH2-8x7B-PlusModel Scale=8x7B2024.05 | 90 | — | — | — | — | |
| TokenSkipBackbone=Qwen3-1.7B, Ratio=1.02026.02 | 90 | — | — | 697 | 115 | |
| Extra-CoTBackbone=Qwen3-1.7B, Ratio=0.42026.02 | 90 | — | — | 301 | 49 | |
| Extra-CoTBackbone=Qwen3-1.7B, Ratio=<POLICY>2026.02 | 90 | — | — | 341 | 52 | |
| MAmmoTH2-8B-PlusModel Scale=8B2024.05 | 89.9 | — | — | — | — | |
| COMTModel=QWEN3-8B, Method=COMT2026.01 | 89.7 | — | — | — | — | |
| AgentVerseDyn.=true, Dis.=false2025.11 | 89.64 | — | — | — | — | |
| PPCVBackbone=Llama-3.1-8B-Instruct2026.02 | 89.6 | — | — | — | — | |
| LLM-BlenderDyn.=false, Dis.=false2025.11 | 89.52 | — | — | — | — | |
| Qwen2-7B-SFT + Full-Step-DPOBackbone=Qwen2-7B, Training Strategy=Full-Step-DPO2025.02 | 89.5 | — | — | — | — | |
| GPTAugBackbone=Qwen2-Math-7B, # Samples=88.62k2025.03 | 89.5 | — | — | — | — | |
| JiuZhang3.0-8BModel Scale=8B, Backbone=LLaMA-3-8B2024.05 | 89.4 | — | — | — | — | |
| JiuZhang3.0-7BSetting=Tool manipulation, Model Size=7B2024.05 | 89.2 | — | — | — | — | |
| JiuZhang3.0-8BSetting=Tool manipulation, Model Size=8B2024.05 | 89.2 | — | — | — | — | |
| Previous SOTAPHP=false, Prompting Strategy=Complex CoT, Decoding Strategy=greedy2023.04 | 89.1 | — | — | — | — | |
| COMTModel=QWEN2.5-7B, Method=COMT2026.01 | 89.1 | — | — | — | — | |
| Tree2026.03 | 88.91 | — | — | — | — | |
| LEMMABackbone=Qwen2-Math-7B, # Samples=88.90k2025.03 | 88.9 | — | — | — | — | |
| Qwen2-7B-SFTBackbone=Qwen2-7B, Training Strategy=SFT2025.02 | 88.7 | — | — | — | — | |
| SC2026.03 | 88.59 | — | — | — | — | |
| DyLANDyn.=true, Dis.=false2025.11 | 88.48 | — | — | — | — | |
| COT-SFTModel=QWEN3-4B, Method=COT-SFT2026.01 | 88.3 | — | — | — | — | |
| COT-SFT+RLModel=QWEN3-4B, Method=COT-SFT+RL2026.01 | 88.3 | — | — | — | — | |
| Single-agent2025.11 | 88.26 | — | — | — | — | |
| Qwen2-7B-SFT + Step-DPOBackbone=Qwen2-7B, Training Strategy=Step-DPO2025.02 | 88.1 | — | — | — | — | |
| MacNetDyn.=false, Dis.=false2025.11 | 88.06 | — | — | — | — | |
| SC (CoTx5)2025.11 | 87.92 | — | — | — | — | |
| OpenMath-CodeLlamaModel Size=70B, Base Model=CodeLlama, Decoding Strategy=Greedy2024.02 | 87.8 | — | — | — | — | |
| Random2026.03 | 87.54 | — | — | — | — | |
| S3C-MathBackbone=Qwen2-Math-7B, # Samples=927k2025.03 | 87.4 | — | — | — | — | |
| CoT2026.03 | 87.36 | — | — | — | — | |
| IAP-mvBackbone=LLaMA-3 70B, Setting=Zero-shot CoT2024.09 | 87.33 | — | — | — | — | |
| DeepSeekMath-7B-RLModel Scale=7B2024.05 | 87.3 | — | — | — | — | |
| Extra-CoTBackbone=Qwen3-1.7B, Ratio=0.22026.02 | 87.3 | — | — | 208 | 34 | |
| Chain2026.03 | 87.17 | — | — | — | — | |
| GPTSwarmDyn.=false, Dis.=false2025.11 | 87.02 | — | — | — | — | |
| DIVERSEModel=code-davinci-0022022.06 | 87 | — | — | — | — | |
| COT-SFTModel=QWEN2.5-7B, Method=COT-SFT2026.01 | 86.8 | — | — | — | — | |
| Self-ConsistencyModel=PaLM 540B2022.06 | 86.6 | — | — | — | — | |
| Vanilla2026.03 | 86.55 | — | — | — | — | |
| Prompt #2Backbone=LLaMA-3 70B, Setting=Zero-shot CoT2024.09 | 86.33 | — | — | — | — | |
| CoT2025.11 | 86.24 | — | — | — | — | |
| Qwen-1.5-110BModel Scale=110B2024.05 | 86.2 | — | — | — | — | |
| UniPROTSelection Protocol=source-wise2026.04 | 86.2 | — | — | — | — | |
| GREATSSelection Protocol=source-wise2026.04 | 86.1 | — | — | — | — | |
| Teaching-Inspired Integrated Prompting FrameworkModel=GPT-3.5-Turbo2024.10 | 86 | — | — | — | — | |
| DeepSeekMath-Base-SFT + Full-Step-DPOBackbone=DeepSeekMath-Base, Training Strategy=Full-Step-DPO2025.02 | 85.9 | — | — | — | — | |
| Predictive DecodingBackbone=Llama-3.1-8B-Instruct2026.02 | 85.9 | — | — | — | — | |
| Self-ConsistencyModel=code-davinci-0022022.06 | 85.8 | — | — | — | — | |
| TokenSkipBackbone=Qwen3-1.7B, Ratio=0.62026.02 | 85.7 | — | — | 502 | 83 | |
| UniPROTSelection Protocol=batch-wise2026.04 | 85.7 | — | — | — | — | |
| Prompt #7Backbone=LLaMA-3 70B, Setting=Zero-shot CoT2024.09 | 85.67 | — | — | — | — | |
| Qwen2.5-MathModel=Qwen2.5-Math, Method=ZERO-SHOT2026.01 | 85.5 | — | — | — | — | |
| DeepSeekMath-Base-SFT + Step-DPOBackbone=DeepSeekMath-Base, Training Strategy=Step-DPO2025.02 | 85.3 | — | — | — | — | |
| GradNormSelection Protocol=source-wise2026.04 | 85.3 | — | — | — | — |