Natural Language Understanding on AdvGLUE (Adversarial Evaluation)
68.29Performance ScoreOurs (+GDPO)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Ours (+GDPO)Alignment=GDPO2026.05 | 68.29 | — | — | — | |
| STAIR2026.05 | 67.75 | — | — | — | |
| DPO2026.05 | 66.27 | — | — | — | |
| Shallow-Align2026.05 | 64.9 | — | — | — | |
| Ours (+SFT)Alignment=SFT2026.05 | 59.62 | — | — | — | |
| Self-Critique2026.05 | 58.4 | — | — | — | |
| Original2026.05 | 58.33 | — | — | — | |
| SFT2026.05 | 57.53 | — | — | — | |
| FedAvg2026.04 | — | 87.3 | 63.7 | -23.6 | |
| FedAvg + AdvTraintraining_mode=adversarial training2026.04 | — | 85.1 | 74.2 | -10.9 | |
| SafeLM2026.04 | — | 86.9 | 77.3 | -9.6 | |
| signSGD + AdvTraintraining_mode=adversarial training2026.04 | — | 84.7 | 73.8 | -10.9 |