Preference Alignment on TL;DR
64.4GRA (%)CW-DPO
Evaluation Results
| Method | Links | |
|---|---|---|
| CW-DPOWeak-to-Strong Model Pair=Qwen2.5-0.5B → Qwen2.5-7B2026.03 | 64.4 | |
| Human (100%)Weak-to-Strong Model Pair=Qwen2.5-0.5B → Qwen2.5-7B2026.03 | 63.4 | |
| CW-DPOWeak-to-Strong Model Pair=OPT-125M → OPT-1.3B2026.03 | 59.5 | |
| Human (100%)Weak-to-Strong Model Pair=OPT-125M → OPT-1.3B2026.03 | 54.2 |