Natural Language Inference on HANS
100AccuracyFine-Tuned
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Fine-TunedBackbone=RoBERTa-large2025.12 | 100 | — | — | — | — | |
| C2POBackbone=DeepSeek2025.12 | 99.6 | — | — | — | — | |
| Task MatrixBackbone=RoBERTa-large, best layer=(16)2025.12 | 96.8 | — | — | — | — | |
| Linear ProbeBackbone=RoBERTa-large2025.12 | 81.3 | — | — | — | — | |
| RoBERTa-large2023.05 | 76.6 | — | — | — | — | |
| ComKD#aug=393k2023.05 | 68.6 | — | — | — | — | |
| WOA**ens#aug=5k, ensemble=true, distillation_step_on_augmented_data_only=true2023.05 | 68.3 | — | — | — | — | |
| DMU full#aug=-2023.05 | 65.9 | — | — | — | — | |
| WOAens#aug=5k, ensemble=true2023.05 | 65.1 | — | — | — | — | |
| GPT-42025.12 | 65.1 | — | — | — | — | |
| KD#aug=-2023.05 | 61.8 | — | — | — | — | |
| Annealing-KD#aug=-2023.05 | 61.2 | — | — | — | — | |
| DistilRoBERTa2023.05 | 59.9 | — | — | — | — | |
| I-SimulCalibration category=Learnable, Backbone=T52022.10 | 57.15 | 80.26 | 38.64 | 15.85 | 75.08 | |
| I-IterCalibration category=Learnable, Backbone=T52022.10 | 57.12 | 74.92 | 28.39 | 22.16 | 71.02 | |
| LSCalibration category=Unlearnable, Backbone=T52022.10 | 56.94 | 83.74 | 26.8 | 16.19 | 83.64 | |
| EnsembleCalibration category=Unlearnable, Backbone=T52022.10 | 56.52 | 91.9 | 35.38 | 6.72 | 90.15 | |
| VanillaCalibration category=Unlearnable, Backbone=T52022.10 | 55.06 | 92.36 | 37.3 | 5.96 | 81.97 | |
| TSCalibration category=Unlearnable, Backbone=T52022.10 | 55.06 | 83.99 | 28.93 | 14.36 | 60.69 | |
| E-MLPCalibration category=Learnable, Backbone=T52022.10 | 55.06 | 87.38 | 32.34 | 12.59 | 87.34 | |
| E-T5Calibration category=Learnable, Backbone=T52022.10 | 55.06 | 78.74 | 35.3 | 19.11 | 75.97 | |
| I-VanillaCalibration category=Learnable, Backbone=T52022.10 | 53.55 | 68.34 | 33.38 | 27.48 | 63.53 | |
| EDACalibration category=Unlearnable, Backbone=T52022.10 | 52.73 | 92.24 | 39.5 | 4.61 | 88.72 |