Natural Language Inference on ANLI R2 (Accuracy)
81.14AccuracyIn-Squeeze
Evaluation Results
| Method | Links | |
|---|---|---|
| In-Squeezerank=128 to 1, schedule=Min steps2026.02 | 81.14 | |
| In-Squeezerank=128 to 1, schedule=Standard2026.02 | 79.63 | |
| Cont-Squeezerank=128 to 1, additional_steps=7002026.02 | 79.52 | |
| Direct Fine-tuningrank=1, additional_steps=02026.02 | 79.3 | |
| Direct Fine-tuningrank=1, additional_steps=7002026.02 | 78.57 | |
| Cont-Squeezerank=128 to 1, additional_steps=2002026.02 | 78.46 | |
| Direct Fine-tuningrank=1, additional_steps=2002026.02 | 77.23 | |
| Direct Fine-tuningrank=1, training_steps=+0 steps2026.02 | 75.11 | |
| Direct Fine-tuningrank=1, training_steps=+200 steps2026.02 | 74.72 | |
| In-Squeezereduction=128 ... -> 1, strategy=Min steps2026.02 | 74.33 | |
| In-Squeezereduction=128 ... -> 1, strategy=Standard2026.02 | 74.16 | |
| Cont-Squeezereduction=128 -> 1, training_steps=+200 steps2026.02 | 73.66 | |
| Cont-Squeezereduction=128 -> 1, training_steps=+700 steps2026.02 | 72.88 | |
| Direct Fine-tuningrank=1, training_steps=+700 steps2026.02 | 72.38 | |
| Self-consistencyPrompting strategy=Self-consistency, Backbone model=PaLM-540B2022.03 | 64.5 | |
| PaLM 2-Lprompting=1-shot2023.05 | 63.4 | |
| CoT-promptingPrompting strategy=Chain-of-Thought, Backbone model=PaLM-540B2022.03 | 58.9 | |
| Standard-prompting (no-rationale)Prompting strategy=no-rationale, Backbone model=PaLM-540B2022.03 | 55.8 | |
| PaLM 2-Mprompting=1-shot2023.05 | 49.5 | |
| PaLM 2-Sprompting=1-shot2023.05 | 48.8 | |
| PaLMprompting=1-shot2023.05 | 48.7 | |
| DenseBase Model=LLaMA-2-7B, Sparsity=Dense2025.06 | 37.2 | |
| DenseBase Model=DeepSeek-7B, Sparsity=Dense2025.06 | 36.6 | |
| SparsegptBase Model=LLaMA-2-7B, Sparsity=2:42025.06 | 34.1 | |
| MaskProBase Model=LLaMA-2-7B, Sparsity=2:42025.06 | 34.1 | |
| Pruner-ZBase Model=LLaMA-2-7B, Sparsity=2:42025.06 | 33.9 | |
| SparsegptBase Model=DeepSeek-7B, Sparsity=2:42025.06 | 33.7 | |
| MaskProBase Model=DeepSeek-7B, Sparsity=2:42025.06 | 33.5 | |
| Pruner-ZBase Model=DeepSeek-7B, Sparsity=2:42025.06 | 33.2 | |
| Cont-Squeezerank=128 to 1, additional_steps=02026.02 | 29.3 | |
| Cont-Squeezereduction=128 -> 1, training_steps=+0 steps2026.02 | 21.26 | |
| Zero-shotmode=0-S2026.02 | 19.9 |