Mathematical Reasoning on AIME 25 (Avg@8, Pass@8, Length)
5.83Avg@8Full-vocab OPD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Full-vocab OPDTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Full-vocab2026.06 | 5.83 | 26.67 | 4,096 | |
| PowerOPD (alpha=500)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=5002026.06 | 5.83 | 16.67 | 2,557 | |
| PowerOPD (alpha=0.5)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=0.52026.06 | 5.42 | 20 | 2,962 | |
| PowerOPD (alpha=1)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=12026.06 | 5 | 16.67 | 3,019 | |
| Vanilla OPD + TanhTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Vanilla, Param=Tanh2026.06 | 4.58 | 20 | 3,012 | |
| PowerOPD (alpha=10)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=102026.06 | 4.58 | 16.67 | 2,853 | |
| Vanilla OPD + Z-ScoreTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Vanilla, Param=Z-Score2026.06 | 4.17 | 13.33 | 2,964 | |
| PowerOPD (alpha=0.1)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=0.12026.06 | 3.75 | 13.33 | 3,024 | |
| PowerOPD (alpha=5)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=52026.06 | 3.75 | 13.33 | 2,939 | |
| PowerOPD (alpha=100)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=1002026.06 | 3.33 | 13.33 | 2,928 | |
| Vanilla OPDTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Vanilla2026.06 | 3.3 | 16.67 | 2,957 | |
| Vanilla OPD + ClipTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Vanilla, Param=Clip2026.06 | 3.3 | 16.67 | 2,935 |