Common Sense Reasoning on BoolQ
92.4AccuracyFine-tuning
Evaluation Results
| Method | Links | |
|---|---|---|
| Fine-tuning2023.06 | 92.4 | |
| Supervised SOTAsupervised=true2022.03 | 91.4 | |
| VanillaBackbone=Qwen3-MoE-30B-A3B, Sparsity=0%2025.11 | 88.7 | |
| PuzzleMoEBackbone=Qwen3-MoE-30B-A3B, Sparsity=25%2025.11 | 88.2 | |
| PaLMParameters=540B, Zero-shot=true, Likelihood Normalization=Answer-conditional2023.02 | 88 | |
| WandaBackbone=Qwen3-MoE-30B-A3B, Sparsity=2:42025.11 | 88 | |
| PuzzleMoEBackbone=Qwen3-MoE-30B-A3B, Sparsity=50%2025.11 | 88 | |
| D2Backbone=Qwen3-MoE-30B-A3B, Sparsity=20%2025.11 | 86.2 | |
| Sub-MoEBackbone=Mixtral-8x7B-v0.1, Sparsity=25%2025.11 | 86 | |
| Sub-MoEBackbone=Qwen3-MoE-30B-A3B, Sparsity=25%2025.11 | 86 | |
| VanillaBackbone=Mixtral-8x7B-v0.1, Sparsity=0%2025.11 | 85.4 | |
| PuzzleMoEBackbone=Mixtral-8x7B-v0.1, Sparsity=25%2025.11 | 85.4 | |
| LLaMAParameters=65B, Zero-shot=true, Likelihood Normalization=Answer-conditional2023.02 | 85.3 | |
| PuzzleMoEBackbone=Mixtral-8x7B-v0.1, Sparsity=50%2025.11 | 85.3 | |
| FP16Model=Qwen2.5-14B2026.03 | 85.23 | |
| HC-SMoEBackbone=Mixtral-8x7B-v0.1, Sparsity=25%2025.11 | 84.9 | |
| PaLMParameters=62B, Zero-shot=true, Likelihood Normalization=Answer-conditional2023.02 | 84.8 | |
| FP16Backbone=Qwen2.5-7B2026.03 | 84.65 | |
| RouterConnection Status=After connection, Collaboration Strategy=Routing-based2026.05 | 84 | |
| DuetNetConnection Status=After connection, Collaboration Strategy=Token-level2026.05 | 84 | |
| NAEEBackbone=Mixtral-8x7B-v0.1, Sparsity=25%2025.11 | 84 | |
| Sub-MoEBackbone=Mixtral-8x7B-v0.1, Sparsity=50%2025.11 | 84 | |
| Sub-MoEBackbone=Qwen3-MoE-30B-A3B, Sparsity=50%2025.11 | 84 | |
| PaLM-contParameters=62B, Zero-shot=true, Likelihood Normalization=Answer-conditional2023.02 | 83.9 | |
| Chinchillazero-shot=true2022.03 | 83.7 | |
| ChinchillaParameters=70B, Zero-shot=true, Likelihood Normalization=Answer-conditional2023.02 | 83.7 | |
| Vicuna-13B (v1.1)Zero-shot=true, Number of Parameters=13B, Version=v1.12023.09 | 83.5 | |
| D2Backbone=Qwen3-MoE-30B-A3B, Sparsity=40%2025.11 | 83.5 | |
| LLaMAParameters=33B, Zero-shot=true, Likelihood Normalization=Answer-conditional2023.02 | 83.1 | |
| STUNBackbone=Mixtral-8x7B-v0.1, Sparsity=25%2025.11 | 83.1 | |
| ASCTotal AI agents=30, Cooperative agents=10, GPU=NVIDIA Tesla P1002026.02 | 83 | |
| HC-SMoEBackbone=Qwen3-MoE-30B-A3B, Sparsity=25%2025.11 | 82.4 | |
| FP16Model=Hymba-Instruct-1.5B, Compression Ratio=1x2026.01 | 82.14 | |
| FP16Backbone=Llama-3.1-8B2026.03 | 82.11 | |
| QMCModel=Hymba-Instruct-1.5B, Memory=2bits-MLC, Compression Ratio=4.44x2026.01 | 82.07 | |
| LAWTotal AI agents=30, Cooperative agents=10, GPU=NVIDIA Tesla P1002026.02 | 82 | |
| Qwen 2.5Connection Status=Before connection2026.05 | 82 | |
| ClusCompBackbone=Llama-3-8B, #Bit=4.13, Zero-shot=true2025.03 | 81.1 | |
| NAEEBackbone=Mixtral-8x7B-v0.1, Sparsity=50%2025.11 | 81 | |
| LLAMA-3-8BModel=LLAMA-3-8B, Bits=FP16, Zero-shot=true2026.04 | 80.95 | |
| HC-SMoEBackbone=Mixtral-8x7B-v0.1, Sparsity=50%2025.11 | 80.8 | |
| HC-SMoEBackbone=Qwen3-MoE-30B-A3B, Sparsity=50%2025.11 | 80.8 | |
| QMCModel=Hymba-Instruct-1.5B, Memory=3bits-MLC, Compression Ratio=4.44x2026.01 | 80.61 | |
| FP16Model=Llama-2-13B2026.03 | 80.55 | |
| ExGRPOStudent Model=Qwen2.5-7B-Instruct2026.02 | 80.3 | |
| GATotal AI agents=30, Cooperative agents=10, GPU=NVIDIA Tesla P1002026.02 | 80 | |
| VanillaBackbone=Qwen1.5-MoE-A2.7B, Sparsity=0%2025.11 | 79.5 | |
| Gopherzero-shot=true2022.03 | 79.3 | |
| GopherParameters=280B, Zero-shot=true, Likelihood Normalization=Answer-conditional2023.02 | 79.3 | |
| WandaBackbone=Mixtral-8x7B-v0.1, Sparsity=2:42025.11 | 79.2 | |
| PuzzleMoEBackbone=Qwen1.5-MoE-A2.7B, Sparsity=25%2025.11 | 79.2 | |
| ClusCompBackbone=Llama-3-8B, #Bit=2.87, Zero-shot=true2025.03 | 79 | |
| NSDSModel=Qwen2.5-14B2026.03 | 78.62 | |
| PuzzleMoEBackbone=Qwen1.5-MoE-A2.7B, Sparsity=50%2025.11 | 78.6 | |
| MT-NLG 530Bzero-shot=true2022.03 | 78.2 | |
| FP16Model=Qwen2.5-1.5B-Instruct, Compression Ratio=1x2026.01 | 78.2 | |
| KurtosisModel=Qwen2.5-14B2026.03 | 78.13 | |
| LLaMAParameters=13B, Zero-shot=true, Likelihood Normalization=Answer-conditional2023.02 | 78.1 | |
| ZDModel=Qwen2.5-14B2026.03 | 77.97 | |
| Llama2-7BZero-shot=true, Number of Parameters=7B2023.09 | 77.9 | |
| RevThinkStudent Model=Qwen2.5-7B-Instruct2026.02 | 77.1 | |
| MSEModel=Qwen2.5-14B2026.03 | 76.94 | |
| NSDSModel=Llama-2-13B2026.03 | 76.75 | |
| MXINT4Model=Hymba-Instruct-1.5B, Compression Ratio=4x2026.01 | 76.73 | |
| LLaMAParameters=7B, Zero-shot=true, Likelihood Normalization=Answer-conditional2023.02 | 76.5 | |
| MultiLoRAparams/task=10M, Backbone=Llama2-7B2026.03 | 76.5 | |
| WandaBackbone=Qwen1.5-MoE-A2.7B, Sparsity=2:42025.11 | 76.2 | |
| EPTparams/task=3.3M, Backbone=Llama2-7B2026.03 | 76.1 | |
| KurtBoostModel=Llama-2-13B2026.03 | 75.91 | |
| WandaBackbone=Deepseek-MoE-16b, Sparsity=2:42025.11 | 75.9 | |
| phi-1.5 (1.3B)Zero-shot=true, Number of Parameters=1.3B2023.09 | 75.8 | |
| EWQModel=Qwen2.5-14B2026.03 | 75.69 | |
| AnsAugStudent Model=Qwen2.5-7B-Instruct2026.02 | 75.53 | |
| RefLoRA-SBackbone=LLaMA3-8B, r=32, Params=0.70%2025.05 | 75.5 | |
| RefLoRABackbone=LLaMA3-8B, r=32, Params=0.70%2025.05 | 75.35 | |
| RefLoRABackbone=LLaMA3-8B, r=16, Params=0.35%2025.05 | 75.26 | |
| EWQModel=Llama-2-13B2026.03 | 75.22 | |
| D2Backbone=Qwen1.5-MoE-A2.7B, Sparsity=20%2025.11 | 75.1 | |
| RandASTotal AI agents=30, Cooperative agents=10, GPU=NVIDIA Tesla P1002026.02 | 75 | |
| RefLoRA-SBackbone=LLaMA3-8B, r=16, Params=0.35%2025.05 | 74.92 | |
| PASERPruning Scheme=SparseGPT, Sparsity=50%2025.02 | 74.79 | |
| ClusCompBackbone=Llama-3-8B, #Bit=2.27, Zero-shot=true2025.03 | 74.7 | |
| MoREparams/task=4.5M, Backbone=Llama2-7B2026.03 | 74.7 | |
| SKDStudent Model=Qwen2.5-7B-Instruct2026.02 | 74.62 | |
| DoRABackbone=LLaMA3-8B, r=32, Params=0.71%2025.05 | 74.6 | |
| FP16Model=Phi-1.5B, Compression Ratio=1x2026.01 | 74.56 | |
| DoRABackbone=LLaMA3-8B, r=16, Params=0.35%2025.05 | 74.5 | |
| PuzzleMoEBackbone=Deepseek-MoE-16b, Sparsity=50%2025.11 | 74.5 | |
| HC-SMoEBackbone=Qwen1.5-MoE-A2.7B, Sparsity=25%2025.11 | 74.2 | |
| LoRA-RITEBackbone=LLaMA3-8B, r=32, Params=0.84%2025.05 | 74.19 | |
| BoHAModel=Llama-3.2-3B, #Params=48.63M2025.09 | 74.19 | |
| ZDModel=Llama-2-13B2026.03 | 74.01 | |
| LoRAparams/task=2.1M, Backbone=Llama2-7B2026.03 | 74 | |
| MPT-7BZero-shot=true, Number of Parameters=7B2023.09 | 73.9 | |
| RTNModel=Phi-1.5B, Format=INT4, Compression Ratio=4x2026.01 | 73.79 | |
| FFTModel=Llama-3.2-3B, #Params=3.21B2025.09 | 73.58 | |
| RefLoRA-SBackbone=LLaMA2-7B, r=32, Params=0.83%2025.05 | 73.36 | |
| MOELoRAparams/task=4.5M, Backbone=Llama2-7B2026.03 | 73.3 | |
| Llama-7BZero-shot=true, Number of Parameters=7B2023.09 | 73.2 | |
| NSDSBackbone=Qwen2.5-7B2026.03 | 73.18 |