Natural Language Inference on ANLI R3 (Adversarial Accuracy)
62.4Clean AccuracySafeLM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SafeLM2026.04 | 62.4 | 55.1 | -7.3 | |
| FedAvg2026.04 | 62.1 | 41.3 | -20.8 | |
| FedAvg + AdvTraintraining_mode=adversarial training2026.04 | 61.8 | 52.4 | -9.4 | |
| signSGD + AdvTraintraining_mode=adversarial training2026.04 | 61.4 | 51.9 | -9.5 |