Commonsense Reasoning on HellaSwag (HellaSwag Score)
86HellaSwag ScoreTILEQ_s
Evaluation Results
| Method | Links | |
|---|---|---|
| TILEQ_sModel=Mixtral-8x7B, Avg.bit=3.162026.05 | 86 | |
| DEITABase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 84.45 | |
| MoDSBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 84.43 | |
| InsTagBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 84.28 | |
| MADS3BBase Model=Llama-3-8B, Training Data Scale=15%, Instructor Model=Llama-3.2-3B-Instruct2026.05 | 84.24 | |
| FullBase Model=Llama-3-8B, Training Data Scale=100%2026.05 | 84.16 | |
| NUGGETSBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 84.11 | |
| MADS8BBase Model=Llama-3-8B, Training Data Scale=15%, Instructor Model=Llama-3.1-8B-Instruct2026.05 | 84.07 | |
| SelectITBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 84.02 | |
| ClusterClipBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 83.94 | |
| IFDBase Model=Llama-3-8B, Training Data Scale=15%2026.05 | 83.38 | |
| LLAMA-4-SCOUTPARAMS=109B, Variant=ORIGINAL2025.11 | 82.9 | |
| MiLoModel=Mixtral-8x7B, Avg.bit=3.42026.05 | 82.2 | |
| LLAMA-4-SCOUTPARAMS=109B, Variant=FCSD2025.11 | 82 | |
| DEITABase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 81.67 | |
| SelectITBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 81.34 | |
| InsTagBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 81.33 | |
| NUGGETSBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 81.32 | |
| MADS3BBase Model=Llama-2-7B, Training Data Scale=15%, Instructor Model=Llama-3.2-3B-Instruct2026.05 | 81.31 | |
| MADS8BBase Model=Llama-2-7B, Training Data Scale=15%, Instructor Model=Llama-3.1-8B-Instruct2026.05 | 81.26 | |
| FullBase Model=Llama-2-7B, Training Data Scale=100%2026.05 | 81.25 | |
| MoDSBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 81.04 | |
| ClusterClipBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 81.02 | |
| IFDBase Model=Llama-2-7B, Training Data Scale=15%2026.05 | 80.82 | |
| DEEPSEEK-V2-LITEPARAMS=16B, Variant=ORIGINAL2025.11 | 80.8 | |
| LLAMA-4-SCOUTPARAMS=109B, Variant=SFT2025.11 | 80 | |
| QWEN-3-30B MOEPARAMS=30B, Variant=ORIGINAL2025.11 | 79.7 | |
| Qwen2.5-7BParameters=7B2026.05 | 78.9 | |
| TILEQ_sModel=Deepseek-MoE, Avg.bit=3.162026.05 | 78.5 | |
| FP16Bit-width=FP16, Evaluation Protocol=zero-shot2026.05 | 78.26 | |
| QWEN-3-30B MOEPARAMS=30B, Variant=FCSD2025.11 | 77.2 | |
| DEEPSEEK-V2-LITEPARAMS=16B, Variant=FCSD2025.11 | 76.9 | |
| QWEN-3-30B MOEPARAMS=30B, Variant=SFT2025.11 | 75.6 | |
| Qwen3.5-4BParameters=4B2026.05 | 75.3 | |
| MiLoModel=Deepseek-MoE, Avg.bit=3.42026.05 | 74.6 | |
| OLMo-3-7BParameters=7B2026.05 | 74.2 | |
| DEEPSEEK-V2-LITEPARAMS=16B, Variant=SFT2025.11 | 74.1 | |
| Mellum 2Parameters=2.5B/12B2026.05 | 73.7 | |
| Qwen3-4BParameters=4B2026.05 | 73.7 | |
| QTIP 2-bit PTQBit-width=2-bit, Evaluation Protocol=zero-shot2026.05 | 71.15 | |
| BCJR-QAT-N4Bit-width=2 bpw, Evaluation Protocol=zero-shot, Configuration=N42026.05 | 70.82 | |
| I-DPOBase Model=Qwen2.5-7B-Instruct2026.05 | 62.2 | |
| I-DPO + MaPPOBase Model=Qwen2.5-7B-Instruct2026.05 | 62.2 | |
| ITBase Model=Qwen2.5-7B-Instruct2026.05 | 62.1 | |
| DPO + MaPPOBase Model=Qwen2.5-7B-Instruct2026.05 | 62.1 | |
| DPOBase Model=Qwen2.5-7B-Instruct2026.05 | 62 | |
| Echo-180MParams=180M, Tokens=10B, Zero-shot=true2026.05 | 44.3 | |
| Mamba-3-MIMO-180MParams=180M, Tokens=100B, Zero-shot=true2026.05 | 41 | |
| Mamba-3-SISO-180MParams=180M, Tokens=100B, Zero-shot=true2026.05 | 40.8 | |
| GDN-180MParams=180M, Tokens=100B, Zero-shot=true2026.05 | 40.2 | |
| Mamba-2-180MParams=180M, Tokens=100B, Zero-shot=true2026.05 | 40.1 | |
| Transformer-180MParams=180M, Tokens=100B, Zero-shot=true2026.05 | 39 | |
| Echo-50MParams=50M, Tokens=3B, Zero-shot=true2026.05 | 29.3 |