Mathematical Reasoning on GSM8K (Avg@8, Pass@8, Response Length)
83.85Avg@8PowerOPD (alpha=500)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PowerOPD (alpha=500)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=5002026.06 | 83.85 | 94.16 | 322 | |
| PowerOPD (alpha=100)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=1002026.06 | 83.06 | 93.93 | 319 | |
| Vanilla OPD + Z-ScoreTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Vanilla, Param=Z-Score2026.06 | 80.26 | 95.22 | 323 | |
| Full-vocab OPDTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Full-vocab2026.06 | 80.25 | 86.5 | 4,095 | |
| PowerOPD (alpha=0.1)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=0.12026.06 | 79.96 | 94.31 | 319 | |
| PowerOPD (alpha=5)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=52026.06 | 79.54 | 94.16 | 312 | |
| PowerOPD (alpha=10)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=102026.06 | 78.79 | 93.93 | 321 | |
| PowerOPD (alpha=0.5)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=0.52026.06 | 78.22 | 94.77 | 308 | |
| Vanilla OPD + TanhTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Vanilla, Param=Tanh2026.06 | 78.02 | 94.92 | 321 | |
| Vanilla OPDTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Vanilla2026.06 | 77.55 | 95.07 | 323 | |
| Vanilla OPD + ClipTeacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=Vanilla, Param=Clip2026.06 | 76.96 | 94.84 | 308 | |
| PowerOPD (alpha=1)Teacher model=Qwen3-8B, Student model=Qwen3-1.7B-Base, Class=PowerOPD, alpha=12026.06 | 76.21 | 94.31 | 311 |