Mathematical Reasoning on Mathematical Reasoning Macro Average
69Pass@16 (Avg)Qwen3-8B + DASD
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-8B + DASDModel Scale=8B, Method=DASD2026.05 | 69 | |
| Qwen3-4B + DASDModel Scale=4B, Method=DASD2026.05 | 68 | |
| Qwen3-4B + GRPOModel Scale=4B, Method=GRPO2026.05 | 64.8 | |
| Qwen3-8B + GRPOModel Scale=8B, Method=GRPO2026.05 | 63.4 | |
| Qwen3-8B + HEPOModel Scale=8B, Method=HEPO2026.05 | 63.4 | |
| Qwen3-8B + RLSDModel Scale=8B, Method=RLSD2026.05 | 63.1 | |
| Qwen3-4B + HEPOModel Scale=4B, Method=HEPO2026.05 | 62.5 | |
| Qwen3-4B + RLSDModel Scale=4B, Method=RLSD2026.05 | 60 | |
| Qwen3-1.7B + DASDModel Scale=1.7B, Method=DASD2026.05 | 57.9 | |
| Qwen3-8B + SRPOModel Scale=8B, Method=SRPO2026.05 | 57 | |
| Qwen3-4B + SRPOModel Scale=4B, Method=SRPO2026.05 | 56.8 | |
| Qwen3-1.7B + HEPOModel Scale=1.7B, Method=HEPO2026.05 | 54.3 | |
| Qwen3-8B + SDPOModel Scale=8B, Method=SDPO2026.05 | 51.4 | |
| Qwen3-1.7B + RLSDModel Scale=1.7B, Method=RLSD2026.05 | 51.3 | |
| Qwen3-4BModel Scale=4B, Method=Base2026.05 | 51.2 | |
| Qwen3-8B + OPSDModel Scale=8B, Method=OPSD2026.05 | 50.8 | |
| Qwen3-1.7B + GRPOModel Scale=1.7B, Method=GRPO2026.05 | 50.1 | |
| Qwen3-4B + OPSDModel Scale=4B, Method=OPSD2026.05 | 50.1 | |
| Qwen3-4B + SDPOModel Scale=4B, Method=SDPO2026.05 | 49.5 | |
| Qwen3-8BModel Scale=8B, Method=Base2026.05 | 49.4 | |
| Qwen3-1.7B + SRPOModel Scale=1.7B, Method=SRPO2026.05 | 47.9 | |
| Qwen3-1.7B + OPSDModel Scale=1.7B, Method=OPSD2026.05 | 43.9 | |
| Qwen3-1.7B + SDPOModel Scale=1.7B, Method=SDPO2026.05 | 43.4 | |
| Qwen3-1.7BModel Scale=1.7B, Method=Base2026.05 | 41.5 |