Preference-Aligned Reasoning on MMLU-Pro
64.3Level ScoreVSPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VSPO2026.05 | 64.3 | 75.4 | |
| Teacher-Trace Distillation (SFT)2026.05 | 45 | 66.3 | |
| SDFT2026.05 | 33.4 | 61.3 | |
| SDPO2026.05 | 31.2 | 45.2 | |
| Reward-Shaped GRPO2026.05 | 30.6 | 63.5 | |
| GRPO with Off-Policy Textual Guidance2026.05 | 30.5 | 59.2 | |
| Teacher-Trace Distillation (SFT) + GRPO2026.05 | 29.1 | 71.6 | |
| Teacher-Trace Distillation (SFT) + GRPO2026.05 | 28 | 67.5 | |
| Original model2026.05 | 26.3 | 44 | |
| Original model2026.05 | 26.3 | 44 | |
| GRPO with Off-Policy Textual Guidance2026.05 | 26.1 | 52.9 | |
| Reward-Shaped GRPO2026.05 | 25.8 | 60.1 | |
| SDPO2026.05 | 22.5 | 54.8 | |
| Teacher-Trace Distillation (SFT)2026.05 | 21.4 | 64.9 | |
| SDFT2026.05 | 20.7 | 59.3 | |
| VSPO2026.05 | 12.4 | 73.7 |