Natural Language Inference on QNLI
96.56AccuracyUD+-XXL
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| UD+-XXLMode=Fully-supervised, Backbone=T5-XXL encoder, Model Parameters=11B2022.11 | 96.56 | — | — | — | |
| Tay et al. (2022)Mode=Fully-supervised, Model Parameters=4x of UD (~44B)2022.11 | 96.5 | — | — | — | |
| FinetunedBackbone=LLAMA-3 8B, LoRA rank=162026.03 | 94.9 | — | — | — | |
| Individual TaskBackbone=Llama-3, Evaluation Protocol=fine-tuned on single tasks2026.04 | 94.49 | — | — | — | |
| Original2022.07 | 90.96 | — | — | — | |
| KnOTS + ENMPBackbone=Llama-3, Scaling factor (λ)=1.1, Top-k (%)=90, ENMP (Elective Neuron Modification Protocol)=true2026.04 | 90.68 | — | — | — | |
| TIES + ENMPBackbone=Llama-3, Scaling factor (λ)=1.2, Top-k (%)=80, ENMP (Elective Neuron Modification Protocol)=true2026.04 | 89.72 | — | — | — | |
| DARE + ENMPBackbone=Llama-3, Scaling factor (λ)=1.1, Top-k (%)=80, Drop rate (p)=0.1, ENMP (Elective Neuron Modification Protocol)=true2026.04 | 89.71 | — | — | — | |
| CoreSpace + ENMPBackbone=Llama-3, Scaling factor (λ)=0.5, ENMP (Elective Neuron Modification Protocol)=true2026.04 | 88.53 | — | — | — | |
| TSV + ENMPBackbone=Llama-3, Scaling factor (λ)=0.6, ENMP (Elective Neuron Modification Protocol)=true2026.04 | 87.11 | — | — | — | |
| LAP2epsilon=3.6452, Backbone=RoBERTa-base2026.02 | 83.73 | — | — | — | |
| Gaussianepsilon=3.6452, Backbone=RoBERTa-base2026.02 | 83.26 | — | — | — | |
| LAP2epsilon=0.9345, Backbone=RoBERTa-base2026.02 | 82.87 | — | — | — | |
| Gaussianepsilon=1.1365, Backbone=RoBERTa-base2026.02 | 82.61 | — | — | — | |
| LAP2epsilon=1.1365, Backbone=RoBERTa-base2026.02 | 82.52 | — | — | — | |
| Gaussianepsilon=0.9345, Backbone=RoBERTa-base2026.02 | 82.17 | — | — | — | |
| Gaussianepsilon=0.5168, Backbone=RoBERTa-base2026.02 | 80.41 | — | — | — | |
| Se²2024.02 | 80.2 | — | — | — | |
| CoreSpaceBackbone=Llama-3, Scaling factor (λ)=0.52026.04 | 79.34 | — | — | — | |
| KnOTSBackbone=Llama-3, Scaling factor (λ)=1.1, Top-k (%)=902026.04 | 79.02 | — | — | — | |
| CusText+epsilon=32022.07 | 77.4 | — | — | — | |
| SANTEXT+epsilon=22022.07 | 76.36 | — | — | — | |
| SANTEXT+epsilon=12022.07 | 76.07 | — | — | — | |
| CusText+epsilon=22022.07 | 76.02 | — | — | — | |
| TA + ENMPBackbone=Llama-3, Scaling factor (λ)=0.3, ENMP (Elective Neuron Modification Protocol)=true2026.04 | 75.97 | — | — | — | |
| CusText+epsilon=12022.07 | 75.28 | — | — | — | |
| LIMECALBase Model=MNLI2021.10 | 75 | 82.6 | — | — | |
| SANTEXT+epsilon=32022.07 | 74.93 | — | — | — | |
| SHAPCALBase Model=MNLI2021.10 | 74.2 | 81.9 | — | — | |
| BOWPROPBase Model=MNLI2021.10 | 74 | 82 | 0 | — | |
| TSVBackbone=Llama-3, Scaling factor (λ)=0.62026.04 | 72.59 | — | — | — | |
| UPRISE2024.02 | 72.5 | — | — | — | |
| KiteBackbone=Llama 3.2–3B2025.09 | 71.68 | — | — | — | |
| CusTextepsilon=32022.07 | 71.33 | — | — | — | |
| BM25Backbone=Qwen 2.5–1.5B2025.09 | 71.11 | — | — | — | |
| KiteBackbone=Qwen 2.5–1.5B2025.09 | 71.05 | — | — | — | |
| DenseBackbone=Qwen 2.5–1.5B2025.09 | 70.73 | — | — | — | |
| CEILBackbone=Qwen 2.5–1.5B2025.09 | 70.53 | — | — | — | |
| RandomBackbone=Qwen 2.5–1.5B2025.09 | 70.21 | — | — | — | |
| CEILBackbone=Llama 3.2–3B2025.09 | 70.08 | — | — | — | |
| DenseBackbone=Llama 3.2–3B2025.09 | 70.04 | — | — | — | |
| LATModel=microsoft/deberta-xxlarge-v2-mnli2023.10 | 70 | — | — | — | |
| BaselineModel=openPangu-Embedded-1B-V1.1, Shots=8-shot2026.05 | 69.9 | — | — | — | |
| AdapShotModel=openPangu-Embedded-1B-V1.1, Shots=adaptive2026.05 | 69.4 | — | — | — | |
| BM25Backbone=Llama 3.2–3B2025.09 | 69.38 | — | — | — | |
| CusTextepsilon=12022.07 | 69.26 | — | — | — | |
| CusTextepsilon=22022.07 | 68.84 | — | — | — | |
| Base modelRuntime (min)=N/A2026.04 | 68.7 | — | — | — | |
| DAREBackbone=Llama-3, Scaling factor (λ)=1.1, Top-k (%)=80, Drop rate (p)=0.12026.04 | 68.44 | — | — | — | |
| RandomBackbone=Llama 3.2–3B2025.09 | 68.43 | — | — | — | |
| AdamWRuntime (min)=8.12026.04 | 68.3 | — | — | — | |
| MuonRuntime (min)=12.02026.04 | 68.2 | — | — | — | |
| POMERuntime (min)=10.62026.04 | 68.2 | — | — | — | |
| SIFTRuntime (min)=26.42026.04 | 68.2 | — | — | — | |
| CCSModel=microsoft/deberta-xxlarge-v2-mnli2023.10 | 68 | — | — | — | |
| BLURRuntime (min)=8.62026.04 | 68 | — | — | — | |
| BaselineModel=openPangu-Embedded-1B-V1.1, Shots=0-shot2026.05 | 67.9 | — | — | — | |
| TIESBackbone=Llama-3, Scaling factor (λ)=1.2, Top-k (%)=802026.04 | 67.6 | — | — | — | |
| KiteBackbone=GPT-Neo 2.7B2025.09 | 65.32 | — | — | — | |
| TABackbone=Llama-3, Scaling factor (λ)=0.32026.04 | 64.94 | — | — | — | |
| DenseBackbone=GPT-Neo 2.7B2025.09 | 64.42 | — | — | — | |
| CEILBackbone=GPT-Neo 2.7B2025.09 | 63.62 | — | — | — | |
| BM25Backbone=GPT-Neo 2.7B2025.09 | 62.12 | — | — | — | |
| AES2024.02 | 61.5 | — | — | — | |
| LAP2epsilon=0.5168, Backbone=RoBERTa-base2026.02 | 60.87 | — | — | — | |
| RandomBackbone=GPT-Neo 2.7B2025.09 | 57.56 | — | — | — | |
| CLSPROBCALBase Model=MNLI2021.10 | 56.7 | 59.5 | — | — | |
| BaselineModel=openPangu-Embedded-1B-V1.1, Shots=128-shot2026.05 | 54.6 | — | — | — | |
| Pythia-6.9BEvaluation protocol=Zero-shot, Parameters=6.9B2024.02 | 53.8 | — | — | — | |
| RPJ-INCITE-7BEvaluation protocol=Zero-shot, Parameters=7B2024.02 | 53.8 | — | — | — | |
| FBDDepsilon=32022.07 | 53.68 | — | — | — | |
| SANTEXTepsilon=32022.07 | 53.57 | — | — | — | |
| Instructor2024.02 | 53.5 | — | — | — | |
| Best-of-102024.02 | 53.2 | — | — | — | |
| SANTEXTepsilon=12022.07 | 53.04 | — | — | — | |
| SANTEXTepsilon=22022.07 | 53.02 | — | — | — | |
| SBERT2024.02 | 52.7 | — | — | — | |
| MPT-7BEvaluation protocol=Zero-shot, Parameters=7B2024.02 | 52.1 | — | — | — | |
| BM252024.02 | 51.9 | — | — | — | |
| Random2024.02 | 51.6 | — | — | — | |
| FBDDepsilon=22022.07 | 51.52 | — | — | — | |
| Zero-shot2024.02 | 50.9 | — | — | — | |
| Laplaceepsilon=3.6452, Backbone=RoBERTa-base2026.02 | 50.76 | — | — | — | |
| MAXPROBBase Model=MNLI2021.10 | 50.5 | 41.2 | — | — | |
| Laplaceepsilon=1.1365, Backbone=RoBERTa-base2026.02 | 50.49 | — | — | — | |
| Random2022.07 | 50.37 | — | — | — | |
| FBDDepsilon=12022.07 | 50.21 | — | — | — | |
| Laplaceepsilon=0.9345, Backbone=RoBERTa-base2026.02 | 50.18 | — | — | — | |
| LLaMA-7BEvaluation protocol=Zero-shot, Parameters=7B2024.02 | 50.1 | — | — | — | |
| Laplaceepsilon=0.5168, Backbone=RoBERTa-base2026.02 | 49.97 | — | — | — | |
| Falcon-7BEvaluation protocol=Zero-shot, Parameters=7B2024.02 | 49.8 | — | — | — | |
| LLaMA2-7BEvaluation protocol=Zero-shot, Parameters=7B2024.02 | 49.4 | — | — | — | |
| OLMo-7BEvaluation protocol=Zero-shot, Parameters=7B2024.02 | 49.1 | — | — | — | |
| AdaMergingBackbone=LLAMA-3 8B, LoRA rank=162026.03 | — | — | — | 84.8 | |
| DARE-TIESBackbone=LLAMA-3 8B, LoRA rank=162026.03 | — | — | — | 88.8 | |
| EMR-MergingBackbone=LLAMA-3 8B, LoRA rank=162026.03 | — | — | — | 88 | |
| FR-MergingBackbone=LLAMA-3 8B, LoRA rank=162026.03 | — | — | — | 88.7 | |
| KnOTS-DARE-TIESBackbone=LLAMA-3 8B, LoRA rank=162026.03 | — | — | — | 82.3 | |
| KnOTS-TIESBackbone=LLAMA-3 8B, LoRA rank=162026.03 | — | — | — | 82 | |
| LinearBackbone=LLAMA-3 8B, LoRA rank=162026.03 | — | — | — | 86.1 |