Arithmetic Reasoning on AQuA, GSM8K, MAWPS, SVAMP
62.2AQuA AccuracyQwen2.5-14B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen2.5-14BParams=14B, Latency (s/token)=0.0982025.12 | 62.2 | 78.5 | 92.4 | 87.4 | 80.1 | |
| LLMBOOST (3B × 2)Params=6B (-1B), Latency (s/token)=0.0432025.12 | 60.2 | 74 | 92.4 | 85.3 | 78 | |
| LLMBOOST (7B × 2)Params=14B, Latency (s/token)=0.0752025.12 | 59.8 | 78.1 | 94.1 | 88.8 | 80.2 | |
| Qwen2.5-7BParams=7B, Latency (s/token)=0.0562025.12 | 56.8 | 75.1 | 92 | 86.1 | 77.5 | |
| LLMBOOST (8B + 3B)Params=11B, Latency (s/token)=0.049, Ensemble Type=Weakly-Heterogeneous2025.12 | 43.7 | 64.4 | 89.7 | 78.6 | 69.1 | |
| Llama 3.1-8BParams=8B, Latency (s/token)=0.038, Ensemble Type=Weakly-Heterogeneous2025.12 | 42.3 | 63.7 | 89.5 | 77.4 | 68.2 | |
| LLama-3.2-3BParams=3B, Latency (s/token)=0.027, Ensemble Type=Weakly-Heterogeneous2025.12 | 31.9 | 49.7 | 84.9 | 65.8 | 58.1 | |
| MagR-DiaBloBase Model=Llama2-13B, Quantization=2-bit, r/N=N = 64, #Params=189M2025.06 | 27.6 | 44.5 | 88.2 | 59.9 | 55.1 | |
| QLoRABase Model=Llama2-13B, Quantization=4-bit, r/N=r = 64, #Params=239M2025.06 | 26.8 | 54.8 | 87 | 69.4 | 59.5 | |
| QLoRABase Model=Llama2-7B, Quantization=4-bit, r/N=r = 64, #Params=112M2025.06 | 26.4 | 42.7 | 87.3 | 58.7 | 53.7 | |
| MagR-DiaBloBase Model=Llama2-7B, Quantization=4-bit, r/N=N = 64, #Params=70M2025.06 | 26.4 | 44.1 | 89.5 | 59 | 54.8 | |
| ApiQ-bwBase Model=Llama2-7B, Quantization=4-bit, r/N=r = 64, #Params=112M2025.06 | 26 | 43.2 | 85.7 | 59 | 53.5 | |
| MagR-DiaBloBase Model=Llama2-13B, Quantization=4-bit, r/N=N = 64, #Params=189M2025.06 | 26 | 55.5 | 89.9 | 66.9 | 59.6 | |
| GPTQ-LoRABase Model=Llama2-13B, Quantization=4-bit, r/N=r = 64, #Params=239M2025.06 | 25.6 | 53.2 | 85.3 | 67.5 | 57.9 | |
| ApiQ-bwBase Model=Llama2-13B, Quantization=4-bit, r/N=r = 64, #Params=239M2025.06 | 25.6 | 55.3 | 87.8 | 67.4 | 59 | |
| LoftQBase Model=Llama2-7B, Quantization=4-bit, r/N=r = 64, #Params=112M2025.06 | 25.3 | 41.7 | 86.3 | 56 | 52.3 | |
| MagR-LoRABase Model=Llama2-13B, Quantization=2-bit, r/N=r = 64, #Params=239M2025.06 | 24.8 | 38.6 | 81.1 | 60.5 | 51.2 | |
| GPTQ-LoRABase Model=Llama2-7B, Quantization=4-bit, r/N=r = 64, #Params=112M2025.06 | 24.3 | 43 | 86.1 | 58.4 | 52.9 | |
| MagR-DiaBloBase Model=Llama2-7B, Quantization=2-bit, r/N=N = 64, #Params=70M2025.06 | 24 | 32.1 | 87 | 51.5 | 48.7 | |
| ApiQ-bwBase Model=Llama2-7B, Quantization=2-bit, r/N=r = 64, #Params=112M2025.06 | 23.9 | 31.2 | 83.9 | 49 | 47.3 | |
| LoftQBase Model=Llama2-13B, Quantization=4-bit, r/N=r = 64, #Params=239M2025.06 | 23.9 | 54.9 | 87.7 | 66.5 | 58.3 | |
| GPTQ-LoRABase Model=Llama2-13B, Quantization=2-bit, r/N=r = 64, #Params=239M2025.06 | 23.6 | 31.9 | 82.5 | 49.6 | 46.9 | |
| ApiQ-bwBase Model=Llama2-13B, Quantization=2-bit, r/N=r = 64, #Params=239M2025.06 | 23.4 | 43.1 | 85.1 | 59.2 | 52.7 | |
| LoftQBase Model=Llama2-7B, Quantization=2-bit, r/N=r = 64, #Params=112M2025.06 | 23.2 | 29.5 | 83.6 | 45.8 | 45.6 | |
| GPTQ-DiaBloBase Model=Llama2-13B, Quantization=2-bit, r/N=N = 64, #Params=189M2025.06 | 23.2 | 41.7 | 87.4 | 58 | 52.6 | |
| GPTQ-DiaBloBase Model=Llama2-7B, Quantization=2-bit, r/N=N = 64, #Params=70M2025.06 | 22.8 | 33.3 | 84 | 50.9 | 47.8 | |
| GPTQ-LoRABase Model=Llama2-7B, Quantization=2-bit, r/N=r = 64, #Params=112M2025.06 | 22.1 | 21.7 | 76.6 | 39 | 39.9 | |
| LoftQBase Model=Llama2-13B, Quantization=2-bit, r/N=r = 64, #Params=239M2025.06 | 21.7 | 37 | 87.7 | 55.9 | 50.6 | |
| MagR-LoRABase Model=Llama2-7B, Quantization=2-bit, r/N=r = 64, #Params=112M2025.06 | 20.5 | 30.9 | 86.6 | 46.9 | 46.2 | |
| QLoRABase Model=Llama2-7B, Quantization=2-bit, r/N=r = 64, #Params=112M2025.06 | 5.1 | 0.9 | 0.8 | 1.5 | 2.1 | |
| QLoRABase Model=Llama2-13B, Quantization=2-bit, r/N=r = 64, #Params=239M2025.06 | 0.9 | 0.5 | 0.1 | 0.7 | 0.6 |