Natural Language Inference on SNLI
100AccuracyNHP Context-Free Data Aug.
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| NHP Context-Free Data Aug.Domain=YouTube2026.01 | 100 | — | |
| UnitedSynT5Year=2024, Model size=3B2024.12 | 94.7 | — | |
| FreeLBTraining=Adversarial Training, Model=RoBERTa2020.10 | 93.4 | — | |
| InfoBERTTraining=Standard Training, Model=RoBERTa2020.10 | 93.3 | — | |
| InfoBERTTraining=Adversarial Training, Model=RoBERTa2020.10 | 93.1 | — | |
| EFLYear=20212024.12 | 93.1 | — | |
| ReLoRAUpdate Source=OpenOrca, Evaluation Protocol=Task-adaptation Methods2026.05 | 93.1 | — | |
| ReLoRAUpdate Source=AlpacaGPT4, Evaluation Protocol=Task-adaptation Methods2026.05 | 93.1 | — | |
| ReLoRAUpdate Source=OpenPlatypus, Evaluation Protocol=Task-adaptation Methods2026.05 | 93.1 | — | |
| Dream-7BPrompt Optimizer=Dream-7B (DLM), Evaluation Model=GPT-4o-mini2026.01 | 93 | — | |
| TextGradPrompt Optimizer=TextGrad (Gradient-based), Evaluation Model=GPT-4o-mini2026.01 | 93 | — | |
| PortLLM+FTUpdate Source=OpenPlatypus, Evaluation Protocol=Task-adaptation Methods2026.05 | 93 | — | |
| PortLLM+FTUpdate Source=AlpacaGPT4, Evaluation Protocol=Task-adaptation Methods2026.05 | 92.7 | — | |
| VanillaTraining=Standard Training, Model=RoBERTa2020.10 | 92.6 | — | |
| Individual TaskBackbone=Llama-3, Evaluation Protocol=fine-tuned on single tasks2026.04 | 92.5 | — | |
| FreeLBTraining=Adversarial Training, Model=BERT2020.10 | 92.4 | — | |
| ORALUpdate Source=OpenPlatypus, Evaluation Protocol=Task-adaptation Methods2026.05 | 92.4 | — | |
| ROBERTa-large+Self-ExplainingBackbone=RoBERTa-large2020.12 | 92.3 | — | |
| ORALUpdate Source=AlpacaGPT4, Evaluation Protocol=Task-adaptation Methods2026.05 | 92.3 | — | |
| InfoBERTTraining=Adversarial Training, Model=BERT2020.10 | 92.2 | — | |
| LoRA-ScratchUpdate Source=OpenPlatypus, Evaluation Protocol=Task-adaptation Methods2026.05 | 92.2 | — | |
| CA-MTLBackbone=RoBERTa-large, External training resources=true2020.12 | 92.1 | — | |
| PortLLM+FTUpdate Source=OpenOrca, Evaluation Protocol=Task-adaptation Methods2026.05 | 92.1 | — | |
| LoRA-ScratchUpdate Source=AlpacaGPT4, Evaluation Protocol=Task-adaptation Methods2026.05 | 92.1 | — | |
| Llama3-8BPrompt Optimizer=Llama3-8B (AR), Evaluation Model=GPT-4o-mini2026.01 | 92 | — | |
| Qwen3-8BPrompt Optimizer=Qwen3-8B (AR), Evaluation Model=GPT-4o-mini2026.01 | 92 | — | |
| ORALUpdate Source=OpenOrca, Evaluation Protocol=Task-adaptation Methods2026.05 | 92 | — | |
| SemBERTExternal training resources=true2020.12 | 91.9 | — | |
| DeBERTa-v3-largeYear=20212024.12 | 91.9 | — | |
| ALIGNModel Variant=large, Model Parameters=355M2023.07 | 91.8 | — | |
| ALBERT-xxlargeYear=20202024.12 | 91.8 | — | |
| LoRA-ScratchUpdate Source=OpenOrca, Evaluation Protocol=Task-adaptation Methods2026.05 | 91.8 | — | |
| ROBERTa-base+Self-ExplainingBackbone=RoBERTa-base2020.12 | 91.7 | — | |
| InfoBERTTraining=Standard Training, Model=BERT2020.10 | 91.7 | — | |
| RoBERTa-largeYear=20192024.12 | 91.7 | — | |
| MT-DNNExternal training resources=true2020.12 | 91.6 | — | |
| XLNet-largeYear=20192024.12 | 91.6 | — | |
| NILE2020.12 | 91.5 | — | |
| ROBERTa-largeBackbone=RoBERTa-large2020.12 | 91.4 | — | |
| SJRCExternal training resources=true2020.12 | 91.3 | — | |
| VanillaTraining=Standard Training, Model=BERT2020.10 | 91.3 | — | |
| StandardModel=RoBERTa-base2021.12 | 91.3 | — | |
| DeBERTa-V3 base + PiFiModel Backbone=DeBERTa-V3-base, PiFi Integration=true, Source LLM=Llama-3.1-8B2025.06 | 91.05 | 90.95 | |
| DeBERTa-V3 baseModel Backbone=DeBERTa-V3-base2025.06 | 90.94 | 90.79 | |
| ROBERTa-base+AvgSelf-ExplainingBackbone=RoBERTa-base2020.12 | 90.8 | — | |
| ALIGNModel Variant=base, Model Parameters=125M2023.07 | 90.8 | — | |
| ROBERTa-baseBackbone=RoBERTa-base2020.12 | 90.7 | — | |
| FLAN-T5Model Variant=xlarge, Model Parameters=3B2023.07 | 90.7 | — | |
| DeBERTa base + PiFiModel Backbone=DeBERTa-base, PiFi Integration=true, Source LLM=Llama-3.1-8B2025.06 | 90.62 | 89.82 | |
| BERTBackbone=BERT-base, Evaluation Protocol=Fine-tuned2021.06 | 90.5 | — | |
| ELECTRA base + PiFiModel Backbone=ELECTRA-base, PiFi Integration=true, Source LLM=Llama-3.1-8B2025.06 | 90.48 | 90.37 | |
| BERT-largeBackbone=BERT-large2020.12 | 90.4 | — | |
| BERT + AlignerBackbone=BERT-base, Evaluation Protocol=Fine-tuned, Alignment Feature=Conditional alignment probability2021.06 | 90.4 | — | |
| CoreSpace + ENMPBackbone=Llama-3, Scaling factor (λ)=0.5, ENMP (Elective Neuron Modification Protocol)=true2026.04 | 90.24 | — | |
| ELECTRA baseModel Backbone=ELECTRA-base2025.06 | 90.11 | 89.95 | |
| BERT-largeYear=20192024.12 | 90.1 | — | |
| GPTYear=20182024.12 | 89.9 | — | |
| FLAN-T5Model Variant=large, Model Parameters=780M2023.07 | 89.7 | — | |
| DeBERTa baseModel Backbone=DeBERTa-base2025.06 | 89.61 | 89.45 | |
| BERT base + PiFiModel Backbone=BERT-base, PiFi Integration=true, Source LLM=Llama-3.1-8B2025.06 | 89.48 | 89.34 | |
| TIES + ENMPBackbone=Llama-3, Scaling factor (λ)=1.2, Top-k (%)=80, ENMP (Elective Neuron Modification Protocol)=true2026.04 | 89.33 | — | |
| TSV + ENMPBackbone=Llama-3, Scaling factor (λ)=0.6, ENMP (Elective Neuron Modification Protocol)=true2026.04 | 89.22 | — | |
| BERT-baseBackbone=BERT-base2020.12 | 89.2 | — | |
| BERT baseModel Backbone=BERT-base2025.06 | 89.1 | 88.92 | |
| DARE + ENMPBackbone=Llama-3, Scaling factor (λ)=1.1, Top-k (%)=80, Drop rate (p)=0.1, ENMP (Elective Neuron Modification Protocol)=true2026.04 | 88.88 | — | |
| TA + ENMPBackbone=Llama-3, Scaling factor (λ)=0.3, ENMP (Elective Neuron Modification Protocol)=true2026.04 | 88.74 | — | |
| RoBERTa baseModel Backbone=RoBERTa-base2025.06 | 88.73 | 88.56 | |
| Fine-TunedBackbone=RoBERTa-large2025.12 | 88.7 | — | |
| CoreSpaceBackbone=Llama-3, Scaling factor (λ)=0.52026.04 | 88.65 | — | |
| RoBERTa base + PiFiModel Backbone=RoBERTa-base, PiFi Integration=true, Source LLM=Llama-3.1-8B2025.06 | 88.49 | 88.37 | |
| TSVBackbone=Llama-3, Scaling factor (λ)=0.62026.04 | 88.21 | — | |
| ESIMYear=20172024.12 | 88 | — | |
| BaselineDescription=Original prompts, Evaluation Model=GPT-4o-mini2026.01 | 88 | — | |
| KnOTS + ENMPBackbone=Llama-3, Scaling factor (λ)=1.1, Top-k (%)=90, ENMP (Elective Neuron Modification Protocol)=true2026.04 | 87.98 | — | |
| RIFTModel=RoBERTa-base2021.12 | 87.9 | — | |
| TIESBackbone=Llama-3, Scaling factor (λ)=1.2, Top-k (%)=802026.04 | 87.74 | — | |
| DAREBackbone=Llama-3, Scaling factor (λ)=1.1, Top-k (%)=80, Drop rate (p)=0.12026.04 | 87.41 | — | |
| NTP Hypernym Baseline Fine-TunedDomain=Combined2026.01 | 87.22 | — | |
| Adv-BaseModel=RoBERTa-base2021.12 | 87.1 | — | |
| Adv-MixoutModel=RoBERTa-base2021.12 | 87.1 | — | |
| TABackbone=Llama-3, Scaling factor (λ)=0.32026.04 | 86.57 | — | |
| DeBERTaAugmentation=BOOSTAUG, Augmentation Backend=EDA2022.10 | 86.39 | 86.16 | |
| Decomposable AttentionYear=20162024.12 | 86.3 | — | |
| Adv-PTWDModel=RoBERTa-base2021.12 | 85.9 | — | |
| OMModel Type=Sequence Encoder2023.11 | 85.5 | — | |
| NHP Context-Aware Data Aug.Domain=Combined2026.01 | 85.47 | — | |
| NSP Context-Free Data Aug.Domain=Combined2026.01 | 85.42 | — | |
| GRZOBackbone=RoBERTa-large (350M), k-shot setting=512, Optimization Protocol=Zeroth-Order, Training Steps=20k, Batch Size=16, Precision=FP162026.06 | 85.4 | — | |
| CRvNNModel Type=Sequence Encoder2023.11 | 85.3 | — | |
| NSP Context-Aware Data Aug.Domain=ArXiv2026.01 | 85.21 | — | |
| RIR-EBT-GRCModel Type=Sequence Encoder2023.11 | 85.1 | — | |
| Fine-TunedBackbone=all-MiniLM-L12-v2, Method (Evaluation Protocol)=Fine-Tuned2025.12 | 85.1 | — | |
| NSP Context-Free Data Aug.Domain=News2026.01 | 85.05 | — | |
| NHP Context-Free Data Aug.Domain=Combined2026.01 | 85.05 | — | |
| RIR-GRCModel Type=Sequence Encoder2023.11 | 85 | — | |
| MorphTECompression Ratio=38x2022.10 | 84.97 | — | |
| OriginalCompression Ratio=1x2022.10 | 84.92 | — | |
| BT-GRCModel Type=Sequence Encoder2023.11 | 84.9 | — | |
| BT-GRC OSModel Type=Sequence Encoder2023.11 | 84.9 | — | |
| Word2ketCompression Ratio=21x2022.10 | 84.87 | — |