Mathematical Reasoning on Minerva (Mean@8)
38Mean@8GSPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GSPOBackbone=Qwen3-4B-Base2026.05 | 38 | |
| DISABackbone=Qwen3-4B-Base2026.05 | 37.4 | |
| FlowRLBackbone=Qwen3-4B-Base2026.05 | 36.8 | |
| FlowRLBackbone=Qwen2.5-7B2026.05 | 34.1 | |
| Offline KDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-4B2026.06 | 33.23 | |
| AsymPOModel=Qwen3-1.7B-Base, Training Data=4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 30.65 | |
| SPOModel=Qwen3-1.7B-Base, Training Data=4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 30 | |
| GRPOBackbone=Qwen3-4B-Base2026.05 | 29 | |
| DEARStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-4B2026.06 | 28.68 | |
| Standard OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-4B2026.06 | 27.94 | |
| DISABackbone=Qwen2.5-7B2026.05 | 27.9 | |
| GRPOModel=Qwen3-1.7B-Base, Training Data=4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 27.53 | |
| VanillaBackbone=Qwen3-4B-Base2026.05 | 26.7 | |
| GSPOBackbone=Qwen2.5-7B2026.05 | 22.7 | |
| GRPOBackbone=Qwen2.5-7B2026.05 | 22.4 | |
| VanillaBackbone=Qwen2.5-7B2026.05 | 22.2 | |
| Base modelStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-4B2026.06 | 20.31 | |
| Offline KDStudent Model=Qwen2.5-1.5B, Teacher Model=Qwen2.5-14B2026.06 | 14.57 | |
| DEARStudent Model=Qwen2.5-1.5B, Teacher Model=Qwen2.5-14B2026.06 | 13.83 | |
| DEARStudent Model=Qwen2.5-1.5B, Teacher Model=Qwen3-4B2026.06 | 13.6 | |
| Offline KDStudent Model=Qwen2.5-1.5B, Teacher Model=Qwen3-4B2026.06 | 12.82 | |
| Standard OPDStudent Model=Qwen2.5-1.5B, Teacher Model=Qwen2.5-14B2026.06 | 12.73 | |
| Standard OPDStudent Model=Qwen2.5-1.5B, Teacher Model=Qwen3-4B2026.06 | 11.63 | |
| Base modelStudent Model=Qwen2.5-1.5B, Teacher Model=Qwen2.5-14B2026.06 | 9.1 | |
| Base modelStudent Model=Qwen2.5-1.5B, Teacher Model=Qwen3-4B2026.06 | 8.69 |