Mathematical Reasoning on AIME 2025 (Acc, Tokens)
73.3Accuracy (%)SAT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SATModel=Qwen3-32B2026.04 | 73.3 | 9,839 | |
| DEERModel=Qwen3-14B2026.04 | 66.7 | 11,135 | |
| DEERModel=Qwen3-32B2026.04 | 66.7 | 10,893 | |
| COTModel=Qwen3-32B2026.04 | 63.3 | 12,203 | |
| COTModel=QwQ-32B2026.04 | 63.3 | 12,554 | |
| COTModel=Qwen3-8B2026.04 | 60 | 12,835 | |
| DEERModel=Qwen3-8B2026.04 | 60 | 12,229 | |
| SATModel=Qwen3-8B2026.04 | 60 | 10,939 | |
| SATModel=Qwen3-14B2026.04 | 60 | 10,637 | |
| COTModel=Qwen3-14B2026.04 | 56.7 | 12,820 | |
| DEERModel=Qwen3-4B2026.04 | 55 | 12,039 | |
| SATModel=Qwen3-4B2026.04 | 53.3 | 9,907 | |
| SATModel=QwQ-32B2026.04 | 53.3 | 11,416 | |
| COTModel=Qwen3-4B2026.04 | 50 | 12,720 | |
| SATModel=DS-Qwen-14B2026.04 | 50 | 8,901 | |
| DEERModel=QwQ-32B2026.04 | 50 | 11,598 | |
| ThinkSwitcherModel=DS-Qwen-14B2026.04 | 42.5 | 10,065 | |
| COTModel=Nemo-Llama-8b2026.04 | 40 | 10,893 | |
| SATModel=Nemo-Llama-8b2026.04 | 40 | 10,400 | |
| ThinkSwitcherModel=DS-Qwen-7B2026.04 | 37.5 | 6,948 | |
| DEERModel=DS-Qwen-7B2026.04 | 36.7 | 7,257 | |
| SATModel=DS-Qwen-7B2026.04 | 36.7 | 9,715 | |
| COTModel=DS-Qwen-14B2026.04 | 36.7 | 11,002 | |
| DEERModel=DS-Qwen-14B2026.04 | 36.7 | 10,125 | |
| DEERModel=Nemo-Llama-8b2026.04 | 36.7 | 11,820 | |
| COTModel=DS-Qwen-7B2026.04 | 30 | 11,028 | |
| ThinkSwitcherModel=DS-Qwen-1.5B2026.04 | 28.3 | 6,689 | |
| COTModel=DS-Qwen-1.5B2026.04 | 23.3 | 11,879 | |
| SATModel=DS-Qwen-1.5B2026.04 | 23.3 | 9,691 | |
| DEERModel=DS-Qwen-1.5B2026.04 | 10 | 9,281 |