Mathematical Reasoning on AIME 24 (Pass@8, Avg@8, Length)
9.17Avg@8PowerOPD (alpha=0.1)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PowerOPD (alpha=0.1)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=0.12026.06 | 9.17 | 23.33 | 3,123 | |
| PowerOPD (alpha=100)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=1002026.06 | 9.17 | 23.33 | 2,869 | |
| Vanilla OPD + TanhTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Vanilla, Param=Tanh2026.06 | 8.33 | 23.33 | 3,107 | |
| PowerOPD (alpha=0.5)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=0.52026.06 | 8.33 | 26.67 | 3,195 | |
| PowerOPD (alpha=1)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=12026.06 | 8.33 | 20 | 3,200 | |
| PowerOPD (alpha=10)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=102026.06 | 8.33 | 26.67 | 3,206 | |
| PowerOPD (alpha=500)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=5002026.06 | 8.33 | 23.33 | 2,705 | |
| Full-vocab OPDTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Full-vocab2026.06 | 7.08 | 16.67 | 4,096 | |
| Vanilla OPDTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Vanilla2026.06 | 7.08 | 20 | 3,045 | |
| Vanilla OPD + ClipTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Vanilla, Param=Clip2026.06 | 7.08 | 23.33 | 3,188 | |
| Vanilla OPD + Z-ScoreTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Vanilla, Param=Z-Score2026.06 | 7.08 | 23.33 | 3,285 | |
| PowerOPD (alpha=5)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=52026.06 | 7.08 | 20 | 3,198 |