Commonsense Reasoning on HELLASWAG (dev)
95.7AccuracyHuman
Evaluation Results
| Method | Links | |
|---|---|---|
| Human2020.04 | 95.7 | |
| ALUMBackbone=ROBERTA-LARGE, Fine-tuning=SMART2020.04 | 86.9 | |
| ALUM-RoBERTa-LargeBackbone=RoBERTa-Large, Training=Adversarial pre-training2020.04 | 86.2 | |
| ALUMBackbone=ROBERTA-LARGE2020.04 | 86.2 | |
| RoBERTa-LargeBackbone=RoBERTa-Large2020.04 | 85 | |
| BERT_LARGE2020.04 | 46.7 | |
| ALUM-BERT-BaseBackbone=BERT-Base, Training=Adversarial pre-training2020.04 | 44 | |
| GPT2020.04 | 41.9 | |
| BERT+-BaseBackbone=BERT-Base, Training=Adversarial fine-tuning2020.04 | 40.3 | |
| BERT-BaseBackbone=BERT-Base2020.04 | 39.5 |