Response-level language alignment on OLA EN-Zh Simple
49.07EN->ZH Embed Pass RateCS-DPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CS-DPOCS-DPO=true, Base Model=OLMo 3.1 (SFT+DPO)2026.01 | 49.07 | 95.94 | |
| OLMo 3.1 (SFT+DPO)CS-DPO=false2026.01 | 32.47 | 97.42 |
| Method | Links | ||
|---|---|---|---|
| CS-DPOCS-DPO=true, Base Model=OLMo 3.1 (SFT+DPO)2026.01 | 49.07 | 95.94 | |
| OLMo 3.1 (SFT+DPO)CS-DPO=false2026.01 | 32.47 | 97.42 |