Mathematical Reasoning on OlympiadBench (Pass@16)
65.6Pass@16Qwen3-8B + DASD
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-8B + DASDModel Scale=8B, Method=DASD2026.05 | 65.6 | |
| Qwen3-4B + DASDModel Scale=4B, Method=DASD2026.05 | 65 | |
| Qwen3-4B + HEPOModel Scale=4B, Method=HEPO2026.05 | 61.6 | |
| Qwen3-8B + GRPOModel Scale=8B, Method=GRPO2026.05 | 60.7 | |
| Qwen3-8B + HEPOModel Scale=8B, Method=HEPO2026.05 | 60.5 | |
| Qwen3-8BModel Scale=8B, Method=Base2026.05 | 59.8 | |
| Qwen3-8B + SRPOModel Scale=8B, Method=SRPO2026.05 | 59.8 | |
| Qwen3-8B + RLSDModel Scale=8B, Method=RLSD2026.05 | 59.2 | |
| Qwen3-1.7B + DASDModel Scale=1.7B, Method=DASD2026.05 | 59 | |
| Qwen3-8B + OPSDModel Scale=8B, Method=OPSD2026.05 | 59 | |
| Qwen3-8B + SDPOModel Scale=8B, Method=SDPO2026.05 | 58.8 | |
| Qwen3-4BModel Scale=4B, Method=Base2026.05 | 58.6 | |
| Qwen3-4B + SDPOModel Scale=4B, Method=SDPO2026.05 | 58.5 | |
| Qwen3-4B + OPSDModel Scale=4B, Method=OPSD2026.05 | 58.2 | |
| Qwen3-4B + SRPOModel Scale=4B, Method=SRPO2026.05 | 57.9 | |
| Qwen3-4B + GRPOModel Scale=4B, Method=GRPO2026.05 | 57 | |
| Qwen3-1.7B + HEPOModel Scale=1.7B, Method=HEPO2026.05 | 56.4 | |
| Qwen3-1.7B + GRPOModel Scale=1.7B, Method=GRPO2026.05 | 54.3 | |
| Qwen3-4B + RLSDModel Scale=4B, Method=RLSD2026.05 | 54 | |
| Qwen3-1.7B + SRPOModel Scale=1.7B, Method=SRPO2026.05 | 53.9 | |
| Qwen3-1.7BModel Scale=1.7B, Method=Base2026.05 | 53.4 | |
| Qwen3-1.7B + SDPOModel Scale=1.7B, Method=SDPO2026.05 | 53.4 | |
| Qwen3-1.7B + OPSDModel Scale=1.7B, Method=OPSD2026.05 | 53.1 | |
| Qwen3-1.7B + RLSDModel Scale=1.7B, Method=RLSD2026.05 | 52.8 |