Mathematical Reasoning on MathQA (test)
87.6AccuracyDense
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DensePruning Ratio=0%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 87.6 | — | |
| RESP w/o re-genPruning Ratio=20%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 84.02 | — | |
| RESPPruning Ratio=20%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 83.69 | — | |
| RESPPruning Ratio=30%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 81.54 | — | |
| RESP w/o re-genPruning Ratio=30%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 80.3 | — | |
| GISPPruning Ratio=20%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 73 | — | |
| RESPPruning Ratio=40%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 59.6 | — | |
| WandaPruning Ratio=20%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 51.42 | — | |
| DR+DADepth=32, 0-SHOT=true2026.01 | 50.8 | 8.3 | |
| DRDepth=16, 0-SHOT=true2026.01 | 45.6 | 5.4 | |
| DRDepth=32, 0-SHOT=true2026.01 | 43.2 | 5.4 | |
| Qwen3-8B + SFT + WeMask(TF)Base Model=Qwen3-8B, Training=SFT, Variant=TF, Shots=0-shot2026.05 | 41.64 | — | |
| Qwen3-8B + WeMask(SFT)Base Model=Qwen3-8B, Training=WeMask(SFT), Shots=0-shot2026.05 | 41.34 | — | |
| Qwen3-8B + SFTBase Model=Qwen3-8B, Training=SFT, Shots=0-shot2026.05 | 41.27 | — | |
| Qwen3-4B + SFT + WeMask(TF)Mask Rate=0.1, Training Protocol=TF, Base Model=Qwen3-4B2026.05 | 37.76 | — | |
| Qwen3-4B + SFT + WeMask(TF)Mask Rate=0.3, Training Protocol=TF, Base Model=Qwen3-4B2026.05 | 37.76 | — | |
| Qwen3-4B + SFT + WeMask(TF)Mask Rate=0.5, Training Protocol=TF, Base Model=Qwen3-4B2026.05 | 37.62 | — | |
| Qwen3-4B + WeMask(SFT)Mask Rate=0.5, Training Protocol=SFT, Base Model=Qwen3-4B2026.05 | 37.55 | — | |
| Qwen3-4B + WeMask(SFT)Mask Rate=0.7, Training Protocol=SFT, Base Model=Qwen3-4B2026.05 | 37.52 | — | |
| Qwen3-4B + SFT + WeMask(TF)Mask Rate=0.7, Training Protocol=TF, Base Model=Qwen3-4B2026.05 | 37.49 | — | |
| Qwen3-4B + WeMask(SFT)Mask Rate=0.3, Training Protocol=SFT, Base Model=Qwen3-4B2026.05 | 37.45 | — | |
| Qwen3-4B + WeMask(SFT)Mask Rate=0.1, Training Protocol=SFT, Base Model=Qwen3-4B2026.05 | 37.42 | — | |
| Qwen3-4B + SFTMask Rate=-, Training Protocol=SFT, Base Model=Qwen3-4B2026.05 | 37.25 | — | |
| DR+DADepth=16, 0-SHOT=true2026.01 | 37.1 | 3.2 | |
| Qwen3-4B + WeMask(SFT)Mask Rate=1.0, Training Protocol=SFT, Base Model=Qwen3-4B2026.05 | 34.47 | — | |
| LoRARank=16, Base Model=LLaMA2-7B, Fine-tuning=true2024.02 | 30.32 | — | |
| Llama3.1-8B-Instruct + WeMask(SFT)Base Model=Llama3.1-8B-Instruct, Training=WeMask(SFT), Shots=0-shot2026.05 | 30.12 | — | |
| Llama3.1-8B-Instruct + SFTBase Model=Llama3.1-8B-Instruct, Training=SFT, Shots=0-shot2026.05 | 28.54 | — | |
| Llama3.1-8B-Instruct + SFT + WeMask(TF)Base Model=Llama3.1-8B-Instruct, Training=SFT, Variant=TF, Shots=0-shot2026.05 | 28.41 | — | |
| GISPPruning Ratio=30%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 27.07 | — | |
| SVD-LLMRatio=0.2, Model=LLaMA-13B, Fine-tuning=true, Mixed-rank strategies=false, Zero-shot evaluation=true2026.02 | 26.5 | — | |
| SAES-SVDRatio=0.2, Model=LLaMA-13B, Fine-tuning=false, Mixed-rank strategies=false, Zero-shot evaluation=true2026.02 | 26.5 | — | |
| ResLoRAisBase Model=LLaMA2-7B, Fine-tuning=true2024.02 | 26 | — | |
| LADepth=32, 0-SHOT=true2026.01 | 26 | 1 | |
| Dip-SVDRatio=0.2, Model=LLaMA-13B, Fine-tuning=false, Mixed-rank strategies=true, Zero-shot evaluation=true2026.02 | 25.8 | — | |
| LoRARank=4, Base Model=LLaMA2-7B, Fine-tuning=true2024.02 | 25.45 | — | |
| ResLoRAbsBase Model=LLaMA2-7B, Fine-tuning=true2024.02 | 24.86 | — | |
| Llama3.1-8B-InstructBase Model=Llama3.1-8B-Instruct, Shots=0-shot2026.05 | 24.69 | — | |
| SAES-SVDRatio=0.4, Model=LLaMA-13B, Fine-tuning=false, Mixed-rank strategies=false, Zero-shot evaluation=true2026.02 | 23.9 | — | |
| ResLoRAmsBase Model=LLaMA2-7B, Fine-tuning=true2024.02 | 23.42 | — | |
| Dip-SVDRatio=0.4, Model=LLaMA-13B, Fine-tuning=false, Mixed-rank strategies=true, Zero-shot evaluation=true2026.02 | 23.3 | — | |
| LADepth=16, 0-SHOT=true2026.01 | 22.9 | 1 | |
| SVD-LLMRatio=0.4, Model=LLaMA-13B, Fine-tuning=true, Mixed-rank strategies=false, Zero-shot evaluation=true2026.02 | 22.8 | — | |
| Qwen3-4B + SFT + WeMask(TF)Mask Rate=1.0, Training Protocol=TF, Base Model=Qwen3-4B2026.05 | 20.87 | — | |
| Qwen3-8BBase Model=Qwen3-8B, Shots=0-shot2026.05 | 20.57 | — | |
| LoHABase Model=LLaMA2-7B, Fine-tuning=true2024.02 | 19.46 | — | |
| LoKrBase Model=LLaMA2-7B, Fine-tuning=true2024.02 | 18.69 | — | |
| AdaLoRABase Model=LLaMA2-7B, Fine-tuning=true2024.02 | 17.62 | — | |
| RESP w/o re-genPruning Ratio=40%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 16.78 | — | |
| GISPPruning Ratio=40%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 12.6 | — | |
| WandaPruning Ratio=30%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 11.22 | — | |
| WandaPruning Ratio=40%, Backbone=Qwen3-8B, prompt=zero-shot2025.12 | 5.73 | — |