Math Reasoning on AIME
74.4Pass@1Thinking onRL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Thinking onRLModel Size=Qwen3-8B, Condition=native RL-trained reasoning mode2026.06 | 74.4 | — | |
| NeuReasonerModel Size=Qwen3-32B, Condition=our cognitive scaffold, thinking off2026.06 | 69.2 | — | |
| Thinking onRLModel Size=Qwen3-32B, Condition=native RL-trained reasoning mode2026.06 | 63.3 | — | |
| VCOREModel=Qwen3 32B2025.10 | 51.67 | 51.67 | |
| VCOREModel=Qwen3 4B2025.10 | 48.33 | 48.33 | |
| SFTModel=Qwen3 8B2025.10 | 48.33 | 48.33 | |
| SFTModel=Qwen3 4B2025.10 | 46.67 | 46.67 | |
| iw-SFTModel=Qwen3 8B2025.10 | 45 | 45 | |
| VCOREModel=Qwen3 8B2025.10 | 45 | 45 | |
| OriginalModel=Qwen3 8B2025.10 | 43.33 | 43.33 | |
| RandomModel=Qwen3 8B2025.10 | 43.33 | 43.33 | |
| OriginalModel=Qwen3 32B2025.10 | 43.33 | 43.33 | |
| DFTModel=Qwen3 32B2025.10 | 43.33 | 43.33 | |
| DFTModel=Qwen3 8B2025.10 | 41.67 | 41.67 | |
| iw-SFTModel=Qwen3 4B2025.10 | 40 | 40 | |
| iw-SFTModel=Qwen3 32B2025.10 | 40 | 40 | |
| RandomModel=Qwen3 32B2025.10 | 40 | 40 | |
| OriginalModel=Qwen3 4B2025.10 | 38.33 | 38.33 | |
| RandomModel=Qwen3 4B2025.10 | 38.33 | 38.33 | |
| SFTModel=Qwen3 32B2025.10 | 38.33 | 38.33 | |
| Thinking offModel Size=Qwen3-32B, Condition=vanilla chain-of-thought, no scaffold2026.06 | 36.7 | — | |
| DFTModel=Qwen3 4B2025.10 | 35 | 35 | |
| NeuReasonerModel Size=Qwen3-8B, Condition=our cognitive scaffold, thinking off2026.06 | 29.2 | — | |
| Thinking offModel Size=Qwen3-8B, Condition=vanilla chain-of-thought, no scaffold2026.06 | 25.6 | — | |
| VCOREModel=LLaMA3.1 8B Instruct2025.10 | 6.67 | 6.67 | |
| iw-SFTModel=LLaMA3.1 8B Instruct2025.10 | 5 | 5 | |
| OriginalModel=LLaMA3.1 8B Instruct2025.10 | 3.33 | 3.33 | |
| SFTModel=LLaMA3.1 8B Instruct2025.10 | 3.33 | 3.33 | |
| DFTModel=LLaMA3.1 8B Instruct2025.10 | 3.33 | 3.33 | |
| RandomModel=LLaMA3.1 8B Instruct2025.10 | 1.67 | 1.67 |