Natural Language Inference on ANLI R3 (Accuracy, Macro-F1)
46.67AccuracyQwen1.5-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen1.5-7BFine-tuning protocol=None2026.02 | 46.67 | 38.05 | |
| Krause-Llama3-8B2026.02 | 45.67 | 39.84 | |
| Llama3-8Bfine-tuning=LoRA2026.02 | 44.92 | 39.57 | |
| Krause-Qwen1.5-7BWindow size=18, top-k=122026.02 | 42.33 | 39.59 | |
| Qwen1.5-7BFine-tuning protocol=LoRA2026.02 | 41.33 | 38.87 | |
| Krause-Qwen1.5-7BWindow size=48, top-k=242026.02 | 41.17 | 38.99 | |
| Krause-Qwen1.5-7BWindow size=32, top-k=162026.02 | 41.17 | 38.62 | |
| DenseBase Model=DeepSeek-7B, Sparsity=Dense2025.06 | 37.75 | — | |
| DenseBase Model=LLaMA-2-7B, Sparsity=Dense2025.06 | 37.58 | — | |
| MaskProBase Model=LLaMA-2-7B, Sparsity=2:42025.06 | 35.67 | — | |
| MaskProBase Model=DeepSeek-7B, Sparsity=2:42025.06 | 33.85 | — | |
| Llama3-8B2026.02 | 33.5 | 17.04 | |
| SparsegptBase Model=DeepSeek-7B, Sparsity=2:42025.06 | 33.33 | — | |
| SparsegptBase Model=LLaMA-2-7B, Sparsity=2:42025.06 | 33.08 | — | |
| Pruner-ZBase Model=DeepSeek-7B, Sparsity=2:42025.06 | 33.04 | — | |
| Pruner-ZBase Model=LLaMA-2-7B, Sparsity=2:42025.06 | 33 | — |