Mathematical Reasoning on GSM8K
97.1AccuracyGHG-TDA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GHG-TDABase Model=Claude 3.5 Sonnet2026.02 | 97.1 | — | — | |
| GPT-4-0613Base model=-, Model size=-, Answer format=code, Eval method=pass@12024.02 | 97 | — | — | |
| GPT-4Protocol=PAL, Setting=Tool manipulation2024.05 | 97 | — | — | |
| GHG-TDABase Model=GPT-4o2026.02 | 96.9 | — | — | |
| AoTBase Model=Claude 3.5 Sonnet2026.02 | 96.8 | — | — | |
| GPT-4o + QuaSARBackbone=GPT-4o, Prompting Strategy=QuaSAR2025.02 | 96.5 | — | — | |
| AoTBase Model=GPT-4o2026.02 | 96.5 | — | — | |
| VATPModel=Qwen3-8B, Budget=32002026.03 | 96.43 | — | — | |
| H2OModel=Qwen3-8B, Budget=32002026.03 | 96.36 | — | — | |
| R-KVModel=Qwen3-8B, Budget=32002026.03 | 96.36 | — | — | |
| LongFlowModel=Qwen3-8B, Budget=32002026.03 | 96.36 | — | — | |
| VATPModel=Qwen3-8B, Budget=24002026.03 | 96.29 | — | — | |
| ToTBase Model=Claude 3.5 Sonnet2026.02 | 96.2 | — | — | |
| MCTS with Const-o-TBackbone=GPT-4.12025.10 | 96.2 | — | — | |
| R-KVModel=Qwen3-8B, Budget=24002026.03 | 96.13 | — | — | |
| Const-o-TBackbone=GPT-4.12025.10 | 96.1 | — | — | |
| ToTBase Model=GPT-4o2026.02 | 96 | — | — | |
| H2OModel=Qwen3-8B, Budget=24002026.03 | 95.98 | — | — | |
| LongFlowModel=Qwen3-8B, Budget=24002026.03 | 95.83 | — | — | |
| VanillaModel=Qwen3-8B, Budget=24002026.03 | 95.68 | — | — | |
| VanillaModel=Qwen3-8B, Budget=32002026.03 | 95.68 | — | — | |
| C-MOP (Ours)Task Model=Q30BA3B-Inst, Optimizer Model=Q30BA3B-Think2026.02 | 95.53 | 82.08 | — | |
| GoTBase Model=Claude 3.5 Sonnet2026.02 | 95.4 | — | — | |
| PromptWizardTask Model=GPT-4, Optimizer Model=GPT-42026.02 | 95.4 | — | — | |
| GoTBase Model=GPT-4o2026.02 | 95.2 | — | — | |
| Llama3.1-70B-InstructLength=128k2024.08 | 95.1 | — | — | |
| CoTBackbone=GPT-4.12025.10 | 95.1 | — | — | |
| MCTS with CoTBackbone=GPT-4.12025.10 | 95.1 | — | — | |
| ProTeGi*Task Model=Q30BA3B-Inst, Optimizer Model=Q30BA3B-Think2026.02 | 95.07 | 78.72 | — | |
| GPO*Task Model=Q30BA3B-Inst, Optimizer Model=Q30BA3B-Think2026.02 | 95.04 | 78.5 | — | |
| GPT-4o + FCoTBackbone=GPT-4o, Prompting Strategy=FCoT2025.02 | 95 | — | — | |
| MCTSBackbone=GPT-4.12025.10 | 95 | — | — | |
| PromptWizard*Task Model=Q30BA3B-Inst, Optimizer Model=Q30BA3B-Think2026.02 | 94.54 | 80.5 | — | |
| GPT-4o + CoTBackbone=GPT-4o, Prompting Strategy=CoT2025.02 | 94.5 | — | — | |
| Gemini UltraBase model=-, Model size=-, Answer format=nlp, Eval method=maj1@322024.02 | 94.4 | — | — | |
| PROMPTEDPrompting Technique=PROMPTED2023.10 | 94.4 | — | — | |
| ePF2025.10 | 94.3 | — | — | |
| BiRouterDyn.=true, Dis.=true2025.11 | 94.09 | — | — | |
| Jupiter-NReasoning mode=on, Temperature=1.0, top-p=0.952026.04 | 94.01 | — | — | |
| GPT-4oBackbone=GPT-4o, Prompting Strategy=Zero-shot2025.02 | 94 | — | — | |
| Output RefinementPrompting Technique=Output Refinement2023.10 | 94 | — | — | |
| CTPBackbone=GPT-4.12025.10 | 94 | — | — | |
| G-DesignerDyn.=false, Dis.=false2025.11 | 93.97 | — | — | |
| SPICEBackbone=Qwen3-8B-Base2026.03 | 93.9 | — | — | |
| GPT-4o + CoMATBackbone=GPT-4o, Prompting Strategy=CoMAT2025.02 | 93.7 | — | — | |
| ToTBackbone=GPT-4.12025.10 | 93.7 | — | — | |
| Zero-Shot CoTPrompting Technique=Zero-Shot Chain-of-Thought2023.10 | 93.6 | — | — | |
| GPT-4Decoding Strategy=Greedy decoding2025.02 | 93.6 | — | — | |
| CoVBackbone=GPT-4.12025.10 | 93.6 | — | — | |
| NemotronReasoning mode=on, Temperature=1.0, top-p=0.952026.04 | 93.56 | — | — | |
| CoTBase Model=Claude 3.5 Sonnet2026.02 | 93.5 | — | — | |
| DenserModel=GPT-4o2025.12 | 93.5 | — | — | |
| DenserBackbone=Qwen3-32B-think2025.12 | 93.4 | — | — | |
| WISTBackbone=Qwen3-8B-Base2026.03 | 93.4 | — | — | |
| MCTS with Const-o-TBackbone=LLaMA-32025.10 | 93.4 | — | — | |
| ERMTask Model=Doubao-Pro, Optimizer Model=GPT-4o2026.02 | 93.3 | — | — | |
| Process SupervisionModel=GPT-4o2025.12 | 93.3 | — | — | |
| Process SupervisionBackbone=Qwen3-32B-think2025.12 | 93.2 | — | — | |
| CoT + RSBackbone=GPT-4.12025.10 | 93.1 | — | — | |
| GPT-4Length=128k2024.08 | 93 | — | — | |
| Llama-3-70B-InstructDecoding Strategy=Greedy decoding2025.02 | 93 | — | — | |
| MegaAgentBackbone=GPT-4o API2024.08 | 93 | — | — | |
| SPO*Task Model=Q30BA3B-Inst, Optimizer Model=Q30BA3B-Think2026.02 | 93 | 78.84 | — | |
| Qwen3-14BPrecision=BF162026.02 | 92.95 | — | — | |
| GPT-4o2025.02 | 92.9 | — | — | |
| Reflection-CoTModel=GPT-4o2025.12 | 92.9 | — | — | |
| WISTBackbone=Qwen3-4B-Base2026.03 | 92.9 | — | — | |
| R-ZeroBackbone=Qwen3-8B-Base2026.03 | 92.9 | — | — | |
| MCTSBackbone=LLaMA-32025.10 | 92.9 | — | — | |
| Reflection-CoTBackbone=Qwen3-32B-think2025.12 | 92.8 | — | — | |
| Qwen2.5-7B + GRPOBase Model=Qwen2.5-7B, Algorithm=GRPO2025.12 | 92.8 | — | — | |
| CoTBase Model=GPT-4o2026.02 | 92.7 | — | — | |
| Qwen2.5-Math-RM-72BSamples=128, Parameter Size=72B2025.03 | 92.7 | — | — | |
| Qwen2.5-Math-RM-72BSamples=64, Parameter Size=72B2025.03 | 92.6 | — | — | |
| ToTBackbone=LLaMA-32025.10 | 92.6 | — | — | |
| SPICEBackbone=Qwen3-4B-Base2026.03 | 92.5 | — | — | |
| Const-o-TBackbone=LLaMA-32025.10 | 92.5 | — | — | |
| Zero-ShotPrompting Technique=Zero-Shot2023.10 | 92.4 | — | — | |
| Tree-of-ThoughtModel=GPT-4o2025.12 | 92.4 | — | — | |
| CoT + RSBackbone=LLaMA-32025.10 | 92.4 | — | — | |
| Self-VerificationModel=GPT-4o2025.12 | 92.3 | — | — | |
| MaASDyn.=true, Dis.=false2025.11 | 92.3 | — | — | |
| Qwen2.5-Math-RM-72BSamples=32, Parameter Size=72B2025.03 | 92.3 | — | — | |
| GPT-42024.05 | 92.2 | — | — | |
| Qwen2.5-7B + Reinforce ++Base Model=Qwen2.5-7B, Algorithm=Reinforce ++2025.12 | 92.2 | — | — | |
| Qwen2.5-7B + ARPOBase Model=Qwen2.5-7B, Algorithm=ARPO2025.12 | 92.2 | — | — | |
| DenserModel=DeepSeek-V32025.12 | 92.1 | — | — | |
| EDU-72BSamples=32, Parameter Size=72B2025.03 | 92.1 | — | — | |
| GPT-4shots=8-shot2023.07 | 92 | — | — | |
| GPT-4Prompt=CoT2023.10 | 92 | — | — | |
| GPT-42024.07 | 92 | — | — | |
| Tree-of-ThoughtBackbone=Qwen3-32B-think2025.12 | 92 | — | — | |
| Self-VerificationBackbone=Qwen3-32B-think2025.12 | 92 | — | — | |
| EDU-72BSamples=64, Parameter Size=72B2025.03 | 92 | — | — | |
| Qwen2.5-Math-RM-72BSamples=16, Parameter Size=72B2025.03 | 91.9 | — | — | |
| CoTBackbone=LLaMA-32025.10 | 91.9 | — | — | |
| Self-ConsistencyModel=GPT-4o2025.12 | 91.8 | — | — | |
| Process SupervisionModel=DeepSeek-V32025.12 | 91.8 | — | — | |
| EDU-72BSamples=16, Parameter Size=72B2025.03 | 91.8 | — | — | |
| MCTS with CoTBackbone=LLaMA-32025.10 | 91.8 | — | — |