Mathematical Reasoning on AMC 23 (Acc, #Tok, LR)
93.3AccVanilla
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VanillaModel=Qwen3-14B2026.02 | 93.3 | 7,190 | — | |
| CGRSModel=Qwen3-14B2026.02 | 93.3 | 5,076 | 29.4 | |
| NEATModel=Qwen3-14B2026.02 | 93.3 | 5,070 | 29.5 | |
| TALEModel=Qwen3-14B2026.02 | 92.5 | 5,951 | 17.2 | |
| DEERModel=Qwen3-14B2026.02 | 90.8 | 4,079 | 43.3 | |
| DynasorModel=Qwen3-14B2026.02 | 90 | 6,030 | 16.1 | |
| VanillaModel=Qwen3-8B2026.02 | 89.4 | 7,876 | — | |
| DynasorModel=Qwen3-8B2026.02 | 89.2 | 6,457 | 18 | |
| CGRSModel=Qwen3-8B2026.02 | 89.2 | 5,595 | 29 | |
| DEERModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 88.3 | 4,670 | 20.3 | |
| CGRSModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 88.3 | 3,406 | 41.9 | |
| NEATModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 88.3 | 4,485 | 23.5 | |
| TALEModel=Qwen3-8B2026.02 | 88.3 | 6,872 | 12.7 | |
| NEATModel=Qwen3-8B2026.02 | 88.3 | 5,820 | 26.1 | |
| VanillaModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 87.5 | 5,861 | — | |
| TALEModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 86.7 | 5,107 | 12.9 | |
| CGRSModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 86.7 | 4,899 | 23.1 | |
| NEATModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 85.6 | 4,945 | 22.4 | |
| TALEModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 85 | 5,915 | 7.2 | |
| DynasorModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 84.2 | 5,201 | 11.3 | |
| VanillaModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 84.2 | 6,374 | — | |
| DynasorModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 84.2 | 5,681 | 10.9 | |
| NoThinkingModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 82.5 | 5,796 | 9.1 | |
| DEERModel=DeepSeek-R1-Distill-Llama-8B2026.02 | 80.8 | 5,480 | 14 | |
| DEERModel=Qwen3-8B2026.02 | 79.2 | 3,715 | 52.8 | |
| NoThinkingModel=Qwen3-14B2026.02 | 77.5 | 1,616 | 77.5 | |
| NoThinkingModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 75.8 | 2,499 | 57.4 | |
| NoThinkingModel=Qwen3-8B2026.02 | 72.5 | 2,426 | 69.2 |