Math Reasoning on AIME 2025 (Accuracy)
97.3Accuracy (AIME 2025)Qwen3-30B-A3B SAO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-30B-A3B SAOBackbone=Qwen3-30B-A3B, Training/Optimization method=SAO2026.07 | 97.3 | |
| GLM-4.72026.07 | 95.7 | |
| GPT-5 High2026.07 | 94.6 | |
| Qwen3-30B-A3B - SAO (w/ DIS only)Backbone=Qwen3-30B-A3B, Training/Optimization method=SAO, DIS mechanism=w/ DIS only2026.07 | 94.2 | |
| Qwen3-30B-A3B - GRPO (+ DIS)Backbone=Qwen3-30B-A3B, Training/Optimization method=GRPO, DIS mechanism=+ DIS2026.07 | 93.5 | |
| Claude-Sonnet-4.52026.07 | 87 | |
| Qwen3-30B-A3B w/o pythonBackbone=Qwen3-30B-A3B, python usage=w/o python2026.07 | 85 | |
| Qwen3-30B-A3B GRPO (w/ python)Backbone=Qwen3-30B-A3B, Training/Optimization method=GRPO, python usage=w/ python2026.07 | 84.2 | |
| Qwen3-30B-A3B SFT (w/ python)Backbone=Qwen3-30B-A3B, Training/Optimization method=SFT, python usage=w/ python2026.07 | 80.4 | |
| Qwen3-30B-A3B w/ pythonBackbone=Qwen3-30B-A3B, python usage=w/ python2026.07 | 14.6 | |
| Qwen3-30B-A3B SFT (w/o python)Backbone=Qwen3-30B-A3B, Training/Optimization method=SFT, python usage=w/o python2026.07 | 14.6 |