Natural Language Inference on MultiNLI Slang (test)
90.06AccuracyRoBERTa
Evaluation Results
| Method | Links | |
|---|---|---|
| RoBERTaMitigation Approach=None2026.04 | 90.06 | |
| GPT-4o-miniMitigation Approach=None2026.04 | 82.55 | |
| Hybrid MitigationMitigation Approach=Hybrid, Base Model=ELECTRA-small2026.04 | 82.14 | |
| AugmentationMitigation Approach=Augmentation, Base Model=ELECTRA-small2026.04 | 81.5 | |
| PreprocessingMitigation Approach=Preprocessing, Base Model=ELECTRA-small2026.04 | 81.38 | |
| ELECTRA-smallMitigation Approach=None2026.04 | 80.83 | |
| GPT-3.5Mitigation Approach=None2026.04 | 65.35 |