Arithmetic Reasoning on Combined Math Datasets (SVAMP, GSM8K, AddSub, MultiArith, AQUA, SingleEq)
92.9Average ScoreDUP
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| DUPModel=GPT-4, Evaluation Protocol=Zero-shot2024.04 | 92.9 | 2.3 | — | — | — | — | — | — | |
| Zero-shot PS+Model=GPT-4, Evaluation Protocol=Zero-shot2024.04 | 91.4 | 0.8 | — | — | — | — | — | — | |
| Zero-shot CoTModel=GPT-4, Evaluation Protocol=Zero-shot2024.04 | 90.6 | — | — | — | — | — | — | — | |
| LoRAModel=Phi-4-14B, # Params (%)=0.752025.09 | 89.9 | — | 95.2 | 99 | 87.5 | 69.3 | 98.7 | 89.9 | |
| DoRAModel=Phi-4-14B, # Params (%)=0.772025.09 | 89.9 | — | 95.2 | 99.2 | 87 | 69.7 | 98.5 | 89.9 | |
| Least-to-MostModel=GPT-4, Evaluation Protocol=Zero-shot2024.04 | 89.7 | -0.9 | — | — | — | — | — | — | |
| DoRAr=1Model=Phi-4-14B, # Params (%)=0.042025.09 | 89.3 | — | 92.9 | 97.8 | 86.8 | 72 | 98.7 | 87.7 | |
| HyperAdaptModel=Phi-4-14B, # Params (%)=0.022025.09 | 89 | — | 93.9 | 99 | 86.5 | 66.9 | 98.3 | 89.4 | |
| LoRAr=1Model=Phi-4-14B, # Params (%)=0.022025.09 | 88.8 | — | 93.7 | 98 | 86.8 | 68.5 | 98.3 | 87.7 | |
| VeRAModel=Phi-4-14B, # Params (%)=0.02 | 0.752025.09 | 88.6 | — | 93.4 | 96.6 | 84.7 | 73.2 | 95.8 | 87.9 | |
| VeRAModel=Qwen-2.5-7B, # Params (%)=0.02 | 0.512025.09 | 88.1 | — | 94.2 | 98.6 | 82.3 | 66.9 | 98.7 | 88.1 | |
| LoRAModel=Qwen-2.5-7B, # Params (%)=1.052025.09 | 87.1 | — | 92.7 | 98.2 | 79.8 | 70.1 | 98.2 | 83.6 | |
| LoRAr=1Model=Qwen-2.5-7B, # Params (%)=0.032025.09 | 87 | — | 93.4 | 98.4 | 82.6 | 63.4 | 97.5 | 86.5 | |
| HyperAdaptModel=Qwen-2.5-7B, # Params (%)=0.032025.09 | 86.9 | — | 92.7 | 98.6 | 79.9 | 68.1 | 98.8 | 83.4 | |
| DoRAr=1Model=Qwen-2.5-7B, # Params (%)=0.052025.09 | 86.8 | — | 91.9 | 98 | 82.6 | 63.4 | 98.8 | 86 | |
| DoRAModel=Qwen-2.5-7B, # Params (%)=1.072025.09 | 86.5 | — | 90.9 | 98.6 | 79.7 | 67.7 | 98.7 | 83.4 | |
| DUPModel=GPT-3.5-Turbo, Evaluation Protocol=Zero-shot2024.04 | 84.9 | 4 | — | — | — | — | — | — | |
| Auto-CoTModel=GPT-3.5-Turbo, Evaluation Protocol=Few-shot2024.04 | 83.4 | 2.5 | — | — | — | — | — | — | |
| Least-to-MostModel=GPT-3.5-Turbo, Evaluation Protocol=Zero-shot2024.04 | 82.6 | 1.7 | — | — | — | — | — | — | |
| Manual-CoTModel=GPT-3.5-Turbo, Evaluation Protocol=Few-shot2024.04 | 82.6 | 1.7 | — | — | — | — | — | — | |
| Zero-shot PS+Model=GPT-3.5-Turbo, Evaluation Protocol=Zero-shot2024.04 | 81.2 | 0.3 | — | — | — | — | — | — | |
| Zero-shot CoTModel=GPT-3.5-Turbo, Evaluation Protocol=Zero-shot2024.04 | 80.9 | — | — | — | — | — | — | — | |
| DoRAModel=Llama-3-8B, # Params (%)=1.052025.09 | 77 | — | 90.1 | 95.9 | 64.3 | 41.3 | 93.2 | 77.4 | |
| LoRAModel=Llama-3-8B, # Params (%)=1.032025.09 | 76.7 | — | 89.6 | 95.9 | 64.4 | 40.9 | 94.2 | 74.9 | |
| HyperAdaptModel=Llama-3-8B, # Params (%)=0.032025.09 | 75.5 | — | 86.3 | 96.7 | 61.9 | 44.1 | 94.2 | 69.8 | |
| VeRAModel=Llama-3-8B, # Params (%)=0.02 | 0.372025.09 | 66.7 | — | 73.7 | 85.6 | 55 | 41.3 | 85 | 59.5 | |
| LoRAr=1Model=Llama-3-8B, # Params (%)=0.032025.09 | 66 | — | 70.1 | 87.6 | 55.3 | 37.4 | 86.5 | 58.9 | |
| DoRAr=1Model=Llama-3-8B, # Params (%)=0.052025.09 | 65.6 | — | 71.9 | 85.4 | 54.3 | 36.6 | 86.2 | 59.2 | |
| GRASSModel=Gemma-2B2026.04 | 60.65 | — | — | — | — | — | — | — | |
| FFTModel=LLaMA2-7B2026.04 | 60.46 | — | — | — | — | — | — | — | |
| FFTModel=Gemma-2B2026.04 | 60.16 | — | — | — | — | — | — | — | |
| GRASSModel=LLaMA2-7B2026.04 | 59.59 | — | — | — | — | — | — | — | |
| DoRAModel=Gemma-2B2026.04 | 59.23 | — | — | — | — | — | — | — | |
| DoRAModel=LLaMA2-7B2026.04 | 59.23 | — | — | — | — | — | — | — | |
| LoRAModel=Gemma-2B, Rank=2562026.04 | 59.16 | — | — | — | — | — | — | — | |
| LoRAModel=LLaMA2-7B, Rank=2562026.04 | 59.11 | — | — | — | — | — | — | — | |
| LoRAModel=LLaMA2-7B, Rank=1282026.04 | 58.83 | — | — | — | — | — | — | — | |
| LoRAModel=Gemma-2B, Rank=1282026.04 | 58.75 | — | — | — | — | — | — | — | |
| LISAModel=LLaMA2-7B2026.04 | 56.57 | — | — | — | — | — | — | — | |
| LISAModel=Gemma-2B2026.04 | 56.46 | — | — | — | — | — | — | — | |
| GRASSModel=TinyLlama2026.04 | 34.22 | — | — | — | — | — | — | — | |
| LISAModel=TinyLlama2026.04 | 33.63 | — | — | — | — | — | — | — | |
| FFTModel=TinyLlama2026.04 | 33.48 | — | — | — | — | — | — | — | |
| DoRAModel=TinyLlama2026.04 | 33.36 | — | — | — | — | — | — | — | |
| LoRAModel=TinyLlama, Rank=2562026.04 | 32.04 | — | — | — | — | — | — | — | |
| LoRAModel=TinyLlama, Rank=1282026.04 | 29.84 | — | — | — | — | — | — | — |