Mathematical Reasoning on MATH 500 (Acc, Tokens)
97AccuracyCOT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| COTModel=QwQ-32B2026.04 | 97 | 4,025 | |
| SATModel=QwQ-32B2026.04 | 97 | 3,256 | |
| SATModel=Qwen3-14B2026.04 | 96.6 | 2,904 | |
| SATModel=Qwen3-32B2026.04 | 96.6 | 2,719 | |
| COTModel=Qwen3-14B2026.04 | 96.2 | 4,598 | |
| SATModel=Qwen3-8B2026.04 | 95.8 | 3,215 | |
| SATModel=Qwen3-4B2026.04 | 95.6 | 2,833 | |
| COTModel=Qwen3-8B2026.04 | 95.6 | 5,166 | |
| COTModel=Qwen3-32B2026.04 | 95.6 | 4,358 | |
| COTModel=Qwen3-4B2026.04 | 95 | 4,823 | |
| SATModel=DS-Qwen-14B2026.04 | 94.8 | 2,515 | |
| DEERModel=QwQ-32B2026.04 | 94.6 | 3,316 | |
| CGRSModel=Qwen3-14B2026.04 | 94.5 | 3,235 | |
| COTModel=DS-Qwen-14B2026.04 | 94.4 | 3,539 | |
| DEERModel=Qwen3-32B2026.04 | 94.2 | 3,418 | |
| CGRSModel=QwQ-32B2026.04 | 94.2 | 2,810 | |
| DEERModel=Qwen3-14B2026.04 | 94 | 3,074 | |
| SATModel=Nemo-Llama-8b2026.04 | 94 | 2,844 | |
| COTModel=Nemo-Llama-8b2026.04 | 93.8 | 3,412 | |
| CGRSModel=Qwen3-8B2026.04 | 93.3 | 3,507 | |
| CGRSModel=Qwen3-32B2026.04 | 93.1 | 2,993 | |
| COTModel=DS-Qwen-7B2026.04 | 92.8 | 3,537 | |
| SATModel=DS-Qwen-7B2026.04 | 92.8 | 2,237 | |
| ThinkSwitcherModel=DS-Qwen-14B2026.04 | 92.7 | 3,572 | |
| DEERModel=Qwen3-4B2026.04 | 92.6 | 3,214 | |
| DEERModel=Qwen3-8B2026.04 | 92.6 | 2,732 | |
| DEERModel=Nemo-Llama-8b2026.04 | 91.4 | 2,995 | |
| CGRSModel=Qwen3-4B2026.04 | 91.3 | 2,704 | |
| ThinkSwitcherModel=DS-Qwen-7B2026.04 | 91.3 | 3,495 | |
| DEERModel=DS-Qwen-7B2026.04 | 89.8 | 2,143 | |
| DEERModel=DS-Qwen-14B2026.04 | 89.8 | 2,577 | |
| CGRSModel=DS-Qwen-7B2026.04 | 87.6 | 1,867 | |
| ThinkSwitcherModel=DS-Qwen-1.5B2026.04 | 82.4 | 4,544 | |
| SATModel=DS-Qwen-1.5B2026.04 | 82.4 | 3,230 | |
| COTModel=DS-Qwen-1.5B2026.04 | 82.2 | 4,723 | |
| DEERModel=DS-Qwen-1.5B2026.04 | 67.8 | 2,497 |