Mathematical Reasoning on OlympiadBench (Avg@8, Pass@8, Response Length)
27.76Avg@8 AccuracyPowerOPD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PowerOPDTeacher=Qwen3-4B, Student=Qwen3-1.7B-Base, alpha=0.12026.06 | 27.76 | 47.26 | 2,332 | |
| PowerOPDTeacher=Qwen3-4B, Student=Qwen3-1.7B-Base, alpha=5002026.06 | 27.74 | 46.37 | 1,857 | |
| PowerOPDTeacher=Qwen3-4B, Student=Qwen3-1.7B-Base, alpha=12026.06 | 27.72 | 47.56 | 2,307 | |
| PowerOPDTeacher=Qwen3-4B, Student=Qwen3-1.7B-Base, alpha=102026.06 | 27.56 | 46.67 | 2,296 | |
| PowerOPDTeacher=Qwen3-4B, Student=Qwen3-1.7B-Base, alpha=52026.06 | 27.28 | 47.11 | 2,289 | |
| Vanilla OPD + TanhTeacher=Qwen3-4B, Student=Qwen3-1.7B-Base2026.06 | 27.17 | 46.96 | 2,359 | |
| PowerOPDTeacher=Qwen3-4B, Student=Qwen3-1.7B-Base, alpha=1002026.06 | 27.06 | 45.78 | 2,042 | |
| Vanilla OPD + ClipTeacher=Qwen3-4B, Student=Qwen3-1.7B-Base2026.06 | 26.74 | 47.41 | 2,390 | |
| PowerOPDTeacher=Qwen3-4B, Student=Qwen3-1.7B-Base, alpha=502026.06 | 26.67 | 46.52 | 2,160 | |
| Vanilla OPDTeacher=Qwen3-4B, Student=Qwen3-1.7B-Base2026.06 | 23.74 | 44.15 | 2,355 | |
| Full-vocab KL OPDTeacher=Qwen3-4B, Student=Qwen3-1.7B-Base2026.06 | 17.62 | 26 | 4,096 | |
| Vanilla OPD + Z-ScoreTeacher=Qwen3-4B, Student=Qwen3-1.7B-Base2026.06 | 14.15 | 38.81 | 2,376 |