Preference-Aligned Reasoning on MATH
46.1LevelVSPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VSPO2026.05 | 46.1 | 83.6 | |
| Teacher-Trace Distillation (SFT)2026.05 | 43.1 | 74 | |
| SDFT2026.05 | 40.6 | 76.3 | |
| GRPO with Off-Policy Textual Guidance2026.05 | 39.8 | 75.3 | |
| Teacher-Trace Distillation (SFT) + GRPO2026.05 | 38.1 | 75.2 | |
| SDPO2026.05 | 29.2 | 72.9 | |
| Reward-Shaped GRPO2026.05 | 27 | 75.2 | |
| Original model2026.05 | 26.5 | 75.1 | |
| Original model2026.05 | 26.5 | 75.1 | |
| SDPO2026.05 | 25.4 | 73.8 | |
| Teacher-Trace Distillation (SFT) + GRPO2026.05 | 24.8 | 77 | |
| Reward-Shaped GRPO2026.05 | 24.3 | 73.7 | |
| SDFT2026.05 | 23.1 | 76.9 | |
| Teacher-Trace Distillation (SFT)2026.05 | 22.4 | 73.9 | |
| GRPO with Off-Policy Textual Guidance2026.05 | 20.1 | 76.4 | |
| VSPO2026.05 | 19.9 | 84.5 |