Natural Language Inference on MultiNLI Emoji (test)
89.8AccuracyRoBERTa
Evaluation Results
| Method | Links | |
|---|---|---|
| RoBERTaMitigation Approach=None2026.04 | 89.8 | |
| GPT-4o-miniMitigation Approach=None2026.04 | 82.36 | |
| Hybrid MitigationMitigation Approach=Hybrid, Base Model=ELECTRA-small2026.04 | 82.2 | |
| PreprocessingMitigation Approach=Preprocessing, Base Model=ELECTRA-small2026.04 | 81.5 | |
| AugmentationMitigation Approach=Augmentation, Base Model=ELECTRA-small2026.04 | 81.48 | |
| ELECTRA-smallMitigation Approach=None2026.04 | 80.97 | |
| GPT-3.5Mitigation Approach=None2026.04 | 65.21 |