Arithmetic Reasoning on AddSub
99AccuracyCLoT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CLoTBackbone=gpt-4o-mini2026.04 | 99 | — | — | |
| CLoTBackbone=gpt-42026.04 | 99 | — | — | |
| CLoTBackbone=deepseek-v32026.04 | 99 | — | — | |
| CoT-SCBackbone=deepseek-v3, n=52026.04 | 98.5 | — | — | |
| CoT-SCBackbone=gpt-4, n=52026.04 | 98.4 | — | — | |
| C-CoTBackbone=gpt-42026.04 | 98.4 | — | — | |
| Teaching-Inspired Integrated Prompting FrameworkModel=GPT-42024.10 | 98.2 | — | — | |
| Meta-Reasoning ParadigmModel=ChatGPT (GPT-3.5-Turbo), Evaluation Protocol=Few-Shot2023.06 | 98 | — | — | |
| CoTBackbone=gpt-42026.04 | 98 | — | — | |
| C-CoTBackbone=deepseek-v32026.04 | 97.9 | — | — | |
| ISP-CoTBackbone=gpt-42026.04 | 97.7 | — | — | |
| CoTBackbone=deepseek-v32026.04 | 97.7 | — | — | |
| TrBackbone=gpt-42026.04 | 97.5 | — | — | |
| C-CoTBackbone=gpt-4o-mini2026.04 | 97.2 | — | — | |
| CoT-SCBackbone=gpt-4o-mini, n=52026.04 | 96.1 | — | — | |
| ISP-CoTBackbone=gpt-4o-mini2026.04 | 96.1 | — | — | |
| Automatic Model Selection with LLMsBackbone=GPT-4, Decoding strategy=Greedy2023.05 | 95.7 | — | — | |
| Previous SoTA2024.10 | 95.7 | — | — | |
| CoTModel=GPT-42024.10 | 95.7 | — | — | |
| Meta-Reasoning ParadigmModel=175B GPT-3 (text-davinci-003), Evaluation Protocol=Few-Shot2023.06 | 95.4 | — | — | |
| DUPModel=GPT-4, Evaluation Protocol=Zero-shot2024.04 | 95.1 | — | — | |
| PALBackbone=GPT-4, Decoding strategy=Greedy2023.05 | 94.9 | — | — | |
| Relevance and LCA operation classifier2022.03 | 94.9 | — | — | |
| CoTBackbone=gpt-4o-mini2026.04 | 94.9 | — | — | |
| FourierMoEModel=Qwen2.5-14B, # Params(%)=0.052026.04 | 94.68 | — | — | |
| CoTBackbone=GPT-4, Decoding strategy=Greedy2023.05 | 93.9 | — | — | |
| Chain-of-Thought ParadigmModel=ChatGPT (GPT-3.5-Turbo), Evaluation Protocol=Few-Shot2023.06 | 93.9 | — | — | |
| ARBackbone=deepseek-v32026.04 | 93.9 | — | — | |
| 8-shot CoTModel=PaLM-540B, Setting=Prev, # Paths=402023.05 | 93.7 | — | — | |
| Self-consistencyBackbone=PaLM-540B2022.03 | 93.7 | — | — | |
| Zero-shot PS+Model=GPT-4, Evaluation Protocol=Zero-shot2024.04 | 93.1 | — | — | |
| MELoRAModel=Qwen2.5-14B, # Params(%)=0.122026.04 | 92.91 | — | — | |
| Teaching-Inspired Integrated Prompting FrameworkModel=GPT-3.5-Turbo2024.10 | 92.7 | — | — | |
| DoRAModel=Qwen2.5-14B, # Params(%)=0.132026.04 | 92.41 | — | — | |
| HydraLoRAModel=Qwen2.5-14B, # Params(%)=0.122026.04 | 92.41 | — | — | |
| Zero-shot CoTModel=GPT-4, Evaluation Protocol=Zero-shot2024.04 | 92.4 | — | — | |
| DUPModel=GPT-3.5-Turbo, Evaluation Protocol=Zero-shot2024.04 | 92.1 | — | — | |
| Least-to-MostModel=GPT-4, Evaluation Protocol=Zero-shot2024.04 | 92.1 | — | — | |
| PALBackbone=Codex, Decoding strategy=Greedy2023.05 | 91.9 | — | — | |
| CoT-promptingBackbone=PaLM-540B2022.03 | 91.9 | — | — | |
| LoRAModel=Qwen2.5-14B, # Params(%)=0.122026.04 | 91.9 | — | — | |
| APEPerturbation=WOO2025.06 | 91.7 | — | — | |
| Automatic Model Selection with LLMsBackbone=Codex, Decoding strategy=Greedy2023.05 | 91.6 | — | — | |
| Self-consistencyBackbone=GPT-3 Code-davinci-0022022.03 | 91.6 | — | — | |
| Chain-of-Thought ParadigmModel=175B GPT-3 (text-davinci-003), Evaluation Protocol=Few-Shot2023.06 | 91.6 | — | — | |
| TopLoRAModel=Qwen2.5-14B, # Params(%)=0.102026.04 | 91.31 | — | — | |
| Least-to-MostModel=GPT-3.5-Turbo, Evaluation Protocol=Zero-shot2024.04 | 91.3 | — | — | |
| Automatic Model Selection with LLMsBackbone=ChatGPT, Decoding strategy=Greedy2023.05 | 90.6 | — | — | |
| Manual-CoTModel=GPT-3.5-Turbo, Evaluation Protocol=Few-shot2024.04 | 90.6 | — | — | |
| APEPerturbation=SC2025.06 | 90.6 | — | — | |
| CoTBackbone=ChatGPT, Decoding strategy=Greedy2023.05 | 90.4 | — | — | |
| StandPerturbation=No Dert.2025.06 | 90.4 | — | — | |
| COSPModel=PaLM-540B, Setting=0-shot, # Paths=7+72023.05 | 89.9 | — | — | |
| Auto-CoTModel=GPT-3.5-Turbo, Evaluation Protocol=Few-shot2024.04 | 89.9 | — | — | |
| RoPPerturbation=UIC2025.06 | 89.9 | — | — | |
| CoTModel=GPT-3.5-Turbo2024.10 | 89.6 | — | — | |
| PALBackbone=ChatGPT, Decoding strategy=Greedy2023.05 | 89.4 | — | — | |
| CoT-promptingBackbone=GPT-3 Code-davinci-0022022.03 | 89.4 | — | — | |
| Auto-CoTModel=PaLM-540B, Setting=0-shot, # Paths=142023.05 | 89.1 | — | — | |
| 0-shot CoTModel=PaLM-540B, Setting=0-shot, # Paths=142023.05 | 88.9 | — | — | |
| StandPerturbation=WOO2025.06 | 88.6 | — | — | |
| CoTBackbone=Codex, Decoding strategy=Greedy2023.05 | 88.4 | — | — | |
| StandPerturbation=SC2025.06 | 88.1 | — | — | |
| FourierMoEModel=LLaMA-3 8B, # Params(%)=0.012026.04 | 87.85 | — | — | |
| RoPPerturbation=EC2025.06 | 87.3 | — | — | |
| ARBackbone=gpt-42026.04 | 87.1 | — | — | |
| StandPerturbation=EC2025.06 | 86.8 | — | — | |
| 5-shot CoTModel=PaLM-540B, Setting=5-shot, # Paths=142023.05 | 86.6 | — | — | |
| Meta-Reasoning ParadigmModel=175B GPT-3 (text-davinci-002), Evaluation Protocol=Few-Shot2023.06 | 86.6 | — | — | |
| Zero-shot PS+Model=GPT-3.5-Turbo, Evaluation Protocol=Zero-shot2024.04 | 86.5 | — | — | |
| CoTPerturbation=SC2025.06 | 86.3 | — | — | |
| CoTPerturbation=WOO2025.06 | 86.3 | — | — | |
| HydraLoRAModel=LLaMA-3 8B, # Params(%)=0.112026.04 | 86.08 | — | — | |
| DoRAModel=LLaMA-3 8B, # Params(%)=0.122026.04 | 85.95 | — | — | |
| MELoRAModel=LLaMA-3 8B, # Params(%)=0.122026.04 | 85.82 | — | — | |
| Zero-shot CoTModel=GPT-3.5-Turbo, Evaluation Protocol=Zero-shot2024.04 | 85.8 | — | — | |
| Chain-of-Thought ParadigmModel=ChatGPT (GPT-3.5-Turbo), Evaluation Protocol=Zero-Shot2023.06 | 85.5 | — | — | |
| Chain-of-Thought ParadigmModel=175B GPT-3 (text-davinci-003), Evaluation Protocol=Zero-Shot2023.06 | 85.3 | — | — | |
| CoTPerturbation=EC2025.06 | 85.3 | — | — | |
| Auto-CoTPrompting=Automatic Chain-of-Thought2022.10 | 84.8 | — | — | |
| RoPPerturbation=WOO2025.06 | 84.6 | — | — | |
| LoRAModel=LLaMA-3 8B, # Params(%)=0.122026.04 | 84.56 | — | — | |
| CoTPerturbation=HW2025.06 | 84.3 | — | — | |
| RoPPerturbation=HW2025.06 | 84.3 | — | — | |
| State-of-the-ArtParadigm=Fine-tuned2023.06 | 84 | — | — | |
| PromptAgentPerturbation=WOO2025.06 | 83.5 | — | — | |
| Few-ShotPrompting=Few-shot2022.10 | 83.3 | — | — | |
| Standard Prompting ParadigmModel=175B GPT-3 (text-davinci-002), Evaluation Protocol=Few-Shot2023.06 | 83.3 | — | — | |
| PromptAgentPerturbation=HW2025.06 | 83.3 | — | — | |
| APEPerturbation=HW2025.06 | 82.8 | — | — | |
| RoPPerturbation=SC2025.06 | 82.5 | — | — | |
| ARBackbone=gpt-4o-mini2026.04 | 82.3 | — | — | |
| StandPerturbation=HW2025.06 | 82 | — | — | |
| Manual-CoTPrompting=Manual Chain-of-Thought2022.10 | 81.3 | — | — | |
| Chain-of-Thought ParadigmModel=175B GPT-3 (text-davinci-002), Evaluation Protocol=Few-Shot2023.06 | 81.3 | — | — | |
| PromptAgentPerturbation=EC2025.06 | 80.8 | — | — | |
| COSPModel=PaLM-62B, Setting=0-shot, # Paths=7+72023.05 | 78.9 | — | — | |
| Zero-ShotPrompting=Zero-shot2022.10 | 77 | — | — | |
| Standard Prompting ParadigmModel=175B GPT-3 (text-davinci-002), Evaluation Protocol=Zero-Shot2023.06 | 77 | — | — | |
| APEPerturbation=EC2025.06 | 76.7 | — | — |