Large Language Model Alignment on Anthropic-HH and Honest (test)
2.617Helpfulness ScoreVC-soup
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VC-soup2026.03 | 2.617 | 0.106 | 4.439 | 2.387 | |
| MODPO2026.03 | 2.605 | -1.579 | 0.737 | 0.963 | |
| DPO-Help2026.03 | 2.371 | -2.555 | -6.533 | -2.238 | |
| MVA2026.03 | 2.106 | -0.018 | 0.159 | 0.749 | |
| LW2026.03 | 1.776 | 0.455 | 2.038 | 1.423 | |
| DPO-Honest2026.03 | 1.457 | -0.851 | 3.797 | 1.465 | |
| SOUP2026.03 | 1.277 | -1.381 | 0.678 | 0.191 | |
| SeqT2026.03 | 0.334 | -0.139 | -13.867 | -4.557 | |
| Base2026.03 | -0.269 | -0.518 | -3.242 | -1.343 | |
| DPO-Harm2026.03 | -1.619 | 1.115 | -14.386 | -4.963 |