Math Reasoning on SVAMP (Accuracy)
96.5AccuracySRQ-driven steering
Evaluation Results
| Method | Links | |
|---|---|---|
| SRQ-driven steeringBackbone=Qwen3-4B-Thinking, Steering Mechanism=PCA-CAA2026.04 | 96.5 | |
| SRQ-driven steeringBackbone=Qwen3-4B-Thinking, Steering Mechanism=Conceptor2026.04 | 96.1 | |
| SRQ-driven steeringBackbone=Qwen3-4B-Thinking, Steering Mechanism=CAA2026.04 | 95.8 | |
| PCA-CAABackbone=Qwen3-4B-Thinking2026.04 | 95.5 | |
| ConceptorBackbone=Qwen3-4B-Thinking2026.04 | 95.4 | |
| CAABackbone=Qwen3-4B-Thinking2026.04 | 95.2 | |
| Base LLMBackbone=Qwen3-4B-Thinking2026.04 | 94.5 | |
| GPT-4oEvaluation Protocol=Closed-Source API, Emission (gCO2/q)=4.52†, Throughput (Tok/s)=55.22026.03 | 94.2 | |
| Gemini 2.5 ProEvaluation Protocol=Closed-Source API, Emission (gCO2/q)=3.90†, Throughput (Tok/s)=58.42026.03 | 94 | |
| Claude 3.5 SonnetEvaluation Protocol=Closed-Source API, Emission (gCO2/q)=3.85†, Throughput (Tok/s)=62.12026.03 | 93.8 | |
| SRQ-driven steeringBackbone=R1-Distill-Llama-8B, Steering Mechanism=PCA-CAA2026.04 | 93.2 | |
| EcoThinkEvaluation Protocol=Adaptive Inference, Emission (gCO2/q)=1.32, Throughput (Tok/s)=148.62026.03 | 92.8 | |
| SRQ-driven steeringBackbone=R1-Distill-Qwen-7B, Steering Mechanism=PCA-CAA2026.04 | 92.7 | |
| SRQ-driven steeringBackbone=R1-Distill-Llama-8B, Steering Mechanism=Conceptor2026.04 | 92.6 | |
| SRQ-driven steeringBackbone=R1-Distill-Qwen-7B, Steering Mechanism=Conceptor2026.04 | 92.5 | |
| PCA-CAABackbone=R1-Distill-Llama-8B2026.04 | 92.4 | |
| SRQ-driven steeringBackbone=R1-Distill-Llama-8B, Steering Mechanism=CAA2026.04 | 92.3 | |
| SRQ-driven steeringBackbone=R1-Distill-Qwen-7B, Steering Mechanism=CAA2026.04 | 92.2 | |
| PCA-CAABackbone=R1-Distill-Qwen-7B2026.04 | 92 | |
| ConceptorBackbone=R1-Distill-Llama-8B2026.04 | 92 | |
| FourierMoEModel=Qwen2.5-14B, # Params(%)=0.052026.04 | 91.8 | |
| ConceptorBackbone=R1-Distill-Qwen-7B2026.04 | 91.6 | |
| CAABackbone=R1-Distill-Llama-8B2026.04 | 91.6 | |
| CAABackbone=R1-Distill-Qwen-7B2026.04 | 91.1 | |
| Base LLMBackbone=R1-Distill-Llama-8B2026.04 | 90.7 | |
| confidence betLLM Family=Qwen 3 (1.7B and 14B), lambda=02026.04 | 90.3 | |
| Base LLMBackbone=R1-Distill-Qwen-7B2026.04 | 90.3 | |
| confidence betLLM Family=Qwen 3 (1.7B and 14B), lambda=0.22026.04 | 89.3 | |
| Imp. rewardLLM Family=Qwen 3 (1.7B and 14B)2026.04 | 89 | |
| Dual KADLLM Family=Qwen 3 (1.7B and 14B), lambda=0.32026.04 | 89 | |
| confidence betLLM Family=Qwen 3 (1.7B and 14B), lambda=0.12026.04 | 89 | |
| p*LLM Family=Qwen 3 (1.7B and 14B)2026.04 | 88.3 | |
| p*LLM Family=OLMo 2 (1B and 13B)2026.04 | 87.6 | |
| TopLoRAModel=Qwen2.5-14B, # Params(%)=0.102026.04 | 87.43 | |
| NudgingLLM Family=Qwen 3 (1.7B and 14B), lambda=0.42026.04 | 87.3 | |
| Dual KADLLM Family=Qwen 3 (1.7B and 14B), lambda=0.42026.04 | 87.3 | |
| FrugalGPT (Cascade)Evaluation Protocol=Standard CoT, Emission (gCO2/q)=1.95, Throughput (Tok/s)=88.52026.03 | 87.2 | |
| HydraLoRAModel=Qwen2.5-14B, # Params(%)=0.122026.04 | 86.97 | |
| DoRAModel=Qwen2.5-14B, # Params(%)=0.132026.04 | 86.8 | |
| q*LLM Family=Qwen 3 (1.7B and 14B)2026.04 | 86.6 | |
| LoRAModel=Qwen2.5-14B, # Params(%)=0.122026.04 | 86.4 | |
| Qwen-3-8B-InstructEvaluation Protocol=Standard CoT, Emission (gCO2/q)=2.12, Throughput (Tok/s)=98.52026.03 | 86.1 | |
| MELoRAModel=Qwen2.5-14B, # Params(%)=0.122026.04 | 85.6 | |
| NudgingLLM Family=Qwen 3 (1.7B and 14B), lambda=0.32026.04 | 85 | |
| Llama-3.1-8B-InstructEvaluation Protocol=Standard CoT, Emission (gCO2/q)=2.15, Throughput (Tok/s)=95.82026.03 | 82.5 | |
| pLLM Family=Qwen 3 (1.7B and 14B)2026.04 | 80 | |
| LoRA + GASTBackbone=LLaMA3-8B2026.03 | 79.4 | |
| confidence betLLM Family=OLMo 2 (1B and 13B), lambda=0.12026.04 | 79.3 | |
| confidence betLLM Family=OLMo 2 (1B and 13B), lambda=0.22026.04 | 79 | |
| confidence betLLM Family=OLMo 2 (1B and 13B), lambda=02026.04 | 77.6 | |
| Dual KADLLM Family=OLMo 2 (1B and 13B), lambda=0.32026.04 | 76.6 | |
| LoRA + ISTBackbone=LLaMA3-8B2026.03 | 76.3 | |
| Dual KADLLM Family=OLMo 2 (1B and 13B), lambda=0.42026.04 | 75.3 | |
| LoRABackbone=LLaMA3-8B2026.03 | 74.4 | |
| FourierMoEModel=LLaMA-3 8B, # Params(%)=0.012026.04 | 73 | |
| Imp. rewardLLM Family=OLMo 2 (1B and 13B)2026.04 | 73 | |
| MELoRAModel=LLaMA-3 8B, # Params(%)=0.122026.04 | 71.2 | |
| DoRAModel=LLaMA-3 8B, # Params(%)=0.122026.04 | 70.4 | |
| q*LLM Family=OLMo 2 (1B and 13B)2026.04 | 70.3 | |
| LoRAModel=LLaMA-3 8B, # Params(%)=0.122026.04 | 70.17 | |
| ChatGPTModel=ChatGPT2026.03 | 69.9 | |
| HydraLoRAModel=LLaMA-3 8B, # Params(%)=0.112026.04 | 68.1 | |
| NudgingLLM Family=OLMo 2 (1B and 13B), lambda=0.32026.04 | 67.3 | |
| NudgingLLM Family=OLMo 2 (1B and 13B), lambda=0.42026.04 | 66.6 | |
| COLMBase Model=Llama-3.2-3B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 60.8 | |
| IDBase Model=Llama-3.2-3B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 58.4 | |
| pLLM Family=OLMo 2 (1B and 13B)2026.04 | 57.6 | |
| PartitionSelBase Model=Llama-3.2-3B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 56.7 | |
| LoRAModel=LLaMA2-7B, Rank=2562026.04 | 56 | |
| FFTModel=LLaMA2-7B2026.04 | 55.5 | |
| GRASSModel=LLaMA2-7B2026.04 | 55.1 | |
| LoRAModel=LLaMA2-7B, Rank=1282026.04 | 54.9 | |
| GradNormBase Model=Llama-3.2-3B, Training Dataset=MetaMathQA, Subset Ratio=12.5%2026.06 | 54.1 | |
| GRASSModel=Gemma-2B2026.04 | 53.5 | |
| DoRAModel=LLaMA2-7B2026.04 | 53.4 | |
| LoRAModel=Gemma-2B, Rank=2562026.04 | 52.3 | |
| FFTModel=Gemma-2B2026.04 | 52.1 | |
| LISAModel=LLaMA2-7B2026.04 | 51.1 | |
| DoRAModel=Gemma-2B2026.04 | 50.9 | |
| LISAModel=Gemma-2B2026.04 | 49.6 | |
| LoRAModel=Gemma-2B, Rank=1282026.04 | 49 | |
| DoRAModel=TinyLlama2026.04 | 29.5 | |
| LoRAModel=TinyLlama, Rank=2562026.04 | 28.2 | |
| GRASSModel=TinyLlama2026.04 | 27.3 | |
| LoRAModel=TinyLlama, Rank=1282026.04 | 27 | |
| qLLM Family=Qwen 3 (1.7B and 14B)2026.04 | 25.3 | |
| LISAModel=TinyLlama2026.04 | 24.9 | |
| FFTModel=TinyLlama2026.04 | 24.1 | |
| qLLM Family=OLMo 2 (1B and 13B)2026.04 | 17.6 |