Natural Language Inference on MNLI Neg
75AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o# Params.=—, Evaluation Setting=In-context learning, Prompting Strategy=Few-shot2026.04 | 75 | |
| OpenAI o1# Params.=—, Evaluation Setting=In-context learning, Prompting Strategy=Zero-shot2026.04 | 74.6 | |
| RoBERTa-large-NSP# Params.=355M, Evaluation Setting=Fully supervised2026.04 | 69.9 | |
| RoBERTa-large# Params.=355M, Evaluation Setting=Fully supervised2026.04 | 69.9 | |
| RoBERTa-large# Params.=355M, Evaluation Setting=Fully supervised, Pre-training Corpus=Best of (¬ATOMIC, ¬ANION)2026.04 | 69.7 | |
| RoBERTa-large# Params.=355M, Evaluation Setting=Fully supervised, Pre-training Corpus=ATOMIC + ANION2026.04 | 69.4 | |
| Qwen2 7B# Params.=7B, Evaluation Setting=In-context learning, Prompting Strategy=Few-shot, Pre-training Corpus=Best of (¬ATOMIC, ¬ANION)2026.04 | 67.5 | |
| Llama 3.1 70B# Params.=70B, Evaluation Setting=In-context learning, Prompting Strategy=Few-shot2026.04 | 65.9 | |
| Llama 3.1 8B# Params.=8B, Evaluation Setting=In-context learning, Prompting Strategy=Few-shot, Pre-training Corpus=Best of (¬ATOMIC, ¬ANION)2026.04 | 63.9 | |
| Qwen2 7B# Params.=7B, Evaluation Setting=In-context learning, Prompting Strategy=Few-shot, Pre-training Corpus=ATOMIC + ANION2026.04 | 63 | |
| BERTNOT# Params.=110M, Evaluation Setting=Fully supervised2026.04 | 60.9 | |
| Qwen2 7B# Params.=7B, Evaluation Setting=In-context learning, Prompting Strategy=Few-shot2026.04 | 59.5 | |
| Llama 3.1 8B# Params.=8B, Evaluation Setting=In-context learning, Prompting Strategy=Few-shot, Pre-training Corpus=ATOMIC + ANION2026.04 | 51.1 | |
| Llama 3.1 8B# Params.=8B, Evaluation Setting=In-context learning, Prompting Strategy=Few-shot2026.04 | 47 |