Natural Language Inference on RTE (dev)
90.5AccuracyEFL
Evaluation Results
| Method | Links | |
|---|---|---|
| EFLTraining Setting=Full training dataset, Backbone=RoBERTa-large2021.04 | 90.5 | |
| Fine-tuningTraining Setting=Full training dataset, Backbone=RoBERTa-large2021.04 | 90.2 | |
| EFLTraining Setting=Few-shot with K=8, Backbone=RoBERTa-large2021.04 | 85.8 | |
| GLaMModel Size=64B/64E, Evaluation Protocol=Few-shot, Shots=82021.12 | 76.2 | |
| GPT-3Model Size=175B, Evaluation Protocol=Few-shot, Shots=322021.12 | 72.9 | |
| GLaMModel Size=64B/64E, Evaluation Protocol=One-shot2021.12 | 71.5 | |
| GPT-3Model Size=175B, Evaluation Protocol=One-shot2021.12 | 70.4 | |
| GLaMModel Size=64B/64E, Evaluation Protocol=Zero-shot2021.12 | 67.9 | |
| GPT-3Model Size=175B, Evaluation Protocol=Zero-shot2021.12 | 63.5 | |
| LM-BFFTraining Setting=Few-shot with K=8, Backbone=RoBERTa-large2021.04 | 63.3 | |
| Fine-tuningTraining Setting=Few-shot with K=8, Backbone=RoBERTa-large2021.04 | 55 | |
| MajorityTraining Setting=Full training dataset, Backbone=RoBERTa-large2021.04 | 52.7 |