Commonsense Question Answering on WinoGrande
77.82AccuracyLlama-3.1-8B-Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama-3.1-8B-InstructModel=Llama-3.1-8B-Instruct, Sparsity=Dense2026.06 | 77.82 | |
| SUBFITModel=Llama-3.1-8B-Instruct, Sparsity=25%2026.06 | 75.22 | |
| DeepSeek-7B-chatModel=DeepSeek-7B-chat, Sparsity=Dense2026.06 | 74.9 | |
| Llama-3.1-8BCompression Ratio=Original2025.10 | 73 | |
| NeuronMLPBase Model=Llama-3.1-8B, Compression Ratio=0.052025.10 | 72 | |
| ConMoEModel=Qwen3-30B-A3B, Reduction ratio=50%, Compression type=None, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 71.5 | |
| FP16Backbone=LLaMA-3-8B, Evaluation Protocol=zero-shot2026.06 | 71.19 | |
| M-SMoEModel=Qwen3-30B-A3B, Reduction ratio=25%, Compression type=Merging, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 71 | |
| ConMoEModel=Qwen3-30B-A3B, Reduction ratio=25%, Compression type=None, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 71 | |
| SUBFITModel=DeepSeek-7B-chat, Sparsity=25%2026.06 | 70.72 | |
| OriginalModel=Qwen3-30B-A3B, Reduction ratio=0%, Compression type=None, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 70.7 | |
| FrequencyModel=Qwen3-30B-A3B, Reduction ratio=25%, Compression type=Pruning, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 70.5 | |
| OriginalModel=deepseek-moe-16b-base, Reduction ratio=0%, Compression type=None, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 70.1 | |
| Llama-3.2-3BCompression Ratio=Original2025.10 | 70 | |
| REAPModel=Qwen3-30B-A3B, Reduction ratio=25%, Compression type=Pruning, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 69.8 | |
| M-SMoEModel=Qwen3-30B-A3B, Reduction ratio=50%, Compression type=Merging, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 69.6 | |
| ConMoEModel=deepseek-moe-16b-base, Reduction ratio=25%, Compression type=None, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 69.6 | |
| HC-SMoEModel=Qwen3-30B-A3B, Reduction ratio=25%, Compression type=Merging, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 69.4 | |
| REAPModel=deepseek-moe-16b-base, Reduction ratio=25%, Compression type=Pruning, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 69.3 | |
| HC-SMoEModel=deepseek-moe-16b-base, Reduction ratio=25%, Compression type=Merging, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 69.1 | |
| FrequencyModel=deepseek-moe-16b-base, Reduction ratio=25%, Compression type=Pruning, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 69.1 | |
| Qwen-3-8BCompression Ratio=Original2025.10 | 69 | |
| NeuronMLPBase Model=Qwen-3-8B, Compression Ratio=0.052025.10 | 69 | |
| FrequencyModel=Qwen3-30B-A3B, Reduction ratio=50%, Compression type=Pruning, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 69 | |
| OriginalModel=OLMoE-1B-7B-0125, Reduction ratio=0%, Compression type=None, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 68.9 | |
| REAPModel=Qwen3-30B-A3B, Reduction ratio=50%, Compression type=Pruning, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 68.5 | |
| M-SMoEModel=deepseek-moe-16b-base, Reduction ratio=25%, Compression type=Merging, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 68.3 | |
| NeuronMLPBase Model=Llama-3.2-3B, Compression Ratio=0.052025.10 | 68 | |
| NeuronMLPBase Model=Qwen-3-4B, Compression Ratio=0.052025.10 | 68 | |
| NeuronMLPBase Model=Qwen-3-8B, Compression Ratio=0.102025.10 | 68 | |
| Llama-3.2-3B-InstructModel=Llama-3.2-3B-Instruct, Sparsity=Dense2026.06 | 67.88 | |
| ConMoEModel=OLMoE-1B-7B-0125, Reduction ratio=25%, Compression type=None, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 67.8 | |
| FP16Backbone=Qwen-3-8B, Evaluation Protocol=zero-shot2026.06 | 67.48 | |
| ConMoEModel=deepseek-moe-16b-base, Reduction ratio=50%, Compression type=None, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 67.4 | |
| REAPModel=OLMoE-1B-7B-0125, Reduction ratio=25%, Compression type=Pruning, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 67.4 | |
| FP16Bits=-, Backbone=LLAMA-2-7B, Zero-shot=true2026.04 | 67.17 | |
| NeuronMLPBase Model=Llama-3.1-8B, Compression Ratio=0.102025.10 | 67 | |
| SAGE-PTQBackbone=LLaMA-3-8B, Evaluation Protocol=zero-shot2026.06 | 66.54 | |
| FrequencyModel=OLMoE-1B-7B-0125, Reduction ratio=25%, Compression type=Pruning, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 66.5 | |
| HC-SMoEModel=OLMoE-1B-7B-0125, Reduction ratio=25%, Compression type=Merging, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 66.2 | |
| Qwen-3-4BCompression Ratio=Original2025.10 | 66 | |
| NeuronMLPBase Model=Qwen-3-4B, Compression Ratio=0.102025.10 | 66 | |
| REAPModel=deepseek-moe-16b-base, Reduction ratio=50%, Compression type=Pruning, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 65.4 | |
| SUBFITModel=Llama-3.2-3B-Instruct, Sparsity=25%2026.06 | 65.35 | |
| HC-SMoEModel=deepseek-moe-16b-base, Reduction ratio=50%, Compression type=Merging, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 64.8 | |
| SAGE-PTQBackbone=Qwen-3-8B, Evaluation Protocol=zero-shot2026.06 | 64.33 | |
| NeuronMLPBase Model=Llama-3.2-3B, Compression Ratio=0.102025.10 | 64 | |
| NeuronMLPBase Model=Qwen-3-4B, Compression Ratio=0.202025.10 | 64 | |
| TransformerModel Scale=4B2026.06 | 63.8 | |
| YOCO (Dense)Model Scale=4B2026.06 | 63 | |
| FrequencyModel=deepseek-moe-16b-base, Reduction ratio=50%, Compression type=Pruning, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 62.8 | |
| M-SMoEModel=OLMoE-1B-7B-0125, Reduction ratio=25%, Compression type=Merging, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 62.6 | |
| NeuronMLPBase Model=Llama-3.1-8B, Compression Ratio=0.202025.10 | 62 | |
| NeuronMLPBase Model=Qwen-3-1.7B, Compression Ratio=0.102025.10 | 62 | |
| NeuronMLPBase Model=Qwen-3-8B, Compression Ratio=0.202025.10 | 62 | |
| YOCO (CLSA)Model Scale=4B, Attention=Cross-Layer Sparse2026.06 | 61.6 | |
| Qwen2.5-7B-InstructModel=Qwen2.5-7B-Instruct, Sparsity=Dense2026.06 | 61.01 | |
| Llama-3.2-1BCompression Ratio=Original2025.10 | 61 | |
| Qwen-3-1.7BCompression Ratio=Original2025.10 | 61 | |
| FP16Backbone=OPT-6.7B, Evaluation Protocol=zero-shot2026.06 | 60.38 | |
| NeuronMLPBase Model=Llama-3.2-3B, Compression Ratio=0.202025.10 | 60 | |
| NeuronMLPBase Model=Qwen-3-1.7B, Compression Ratio=0.052025.10 | 60 | |
| NeuronMLPBase Model=Llama-3.2-1B, Compression Ratio=0.052025.10 | 59 | |
| SAGE-PTQBackbone=OPT-6.7B, Evaluation Protocol=zero-shot2026.06 | 58.56 | |
| LBLLMBits=W(1+1)A4, Backbone=LLAMA-2-7B, Zero-shot=true2026.04 | 58.27 | |
| BiLLMBackbone=LLaMA-3-8B, Evaluation Protocol=zero-shot2026.06 | 58.12 | |
| BWABits=W(1+1)A4, Backbone=LLAMA-2-7B, Zero-shot=true2026.04 | 58.01 | |
| NeuronMLPBase Model=Qwen-3-1.7B, Compression Ratio=0.202025.10 | 58 | |
| SUBFITModel=Qwen2.5-7B-Instruct, Sparsity=25%2026.06 | 57.85 | |
| REAPModel=OLMoE-1B-7B-0125, Reduction ratio=50%, Compression type=Pruning, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 57.5 | |
| FrequencyModel=OLMoE-1B-7B-0125, Reduction ratio=50%, Compression type=Pruning, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 57 | |
| ConMoEModel=OLMoE-1B-7B-0125, Reduction ratio=50%, Compression type=None, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 57 | |
| Qwen3-4B-InstructModel=Qwen3-4B-Instruct, Sparsity=Dense2026.06 | 56.75 | |
| HC-SMoEModel=OLMoE-1B-7B-0125, Reduction ratio=50%, Compression type=Merging, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 56.4 | |
| M-SMoEModel=deepseek-moe-16b-base, Reduction ratio=50%, Compression type=Merging, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 56.3 | |
| NeuronMLPBase Model=Llama-3.2-1B, Compression Ratio=0.102025.10 | 55 | |
| SUBFITModel=Qwen3-4B-Instruct, Sparsity=25%2026.06 | 54.93 | |
| ARB-LLMBits=W(1+1)A4, Backbone=LLAMA-2-7B, Zero-shot=true2026.04 | 54.54 | |
| NeuronMLPBase Model=Llama-3.2-1B, Compression Ratio=0.202025.10 | 54 | |
| BiLLMBackbone=Qwen-3-8B, Evaluation Protocol=zero-shot2026.06 | 53 | |
| HC-SMoEModel=Qwen3-30B-A3B, Reduction ratio=50%, Compression type=Merging, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 52.1 | |
| M-SMoEModel=OLMoE-1B-7B-0125, Reduction ratio=50%, Compression type=Merging, Evaluation protocol=One-shot, no post-compression fine-tuning2026.05 | 51.5 | |
| BiLLMBackbone=OPT-6.7B, Evaluation Protocol=zero-shot2026.06 | 51.5 | |
| Low-RankModel Scale=1B, Rank (r)=512, Evaluation Protocol=Zero-shot2026.06 | 51.16 | |
| Full-RankModel Scale=1B, Rank (r)=512, Evaluation Protocol=Zero-shot2026.06 | 51.1 | |
| DLR +Low-RankModel Scale=1B, Rank (r)=512, Evaluation Protocol=Zero-shot2026.06 | 50.69 | |
| DLR +CoLAModel Scale=1B, Rank (r)=512, Evaluation Protocol=Zero-shot2026.06 | 50.61 | |
| BiLLMBits=W(1+1)A4, Backbone=LLAMA-2-7B, Zero-shot=true2026.04 | 49.49 | |
| QuaRotBits=W2A4, Backbone=LLAMA-2-7B, Zero-shot=true2026.04 | 48.15 |