Chain-of-Thought Reasoning on AIME 24
81.46AccuracyVanilla
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VanillaModel=Qwen3-14B2026.06 | 81.46 | 13,872 | — | |
| CUSUMModel=Qwen3-14B2026.06 | 77.71 | 12,141 | 12.5 | |
| VanillaModel=Qwen3-4B-Thinking-25072026.06 | 77.29 | 19,178 | — | |
| CUSUMModel=Qwen3-4B-Thinking-25072026.06 | 76.88 | 18,714 | 2.4 | |
| DynasorModel=Qwen3-14B2026.06 | 76.22 | 12,508 | 9.8 | |
| DEERModel=Qwen3-4B-Thinking-25072026.06 | 76 | 18,925 | 1.3 | |
| DynasorModel=Qwen3-4B-Thinking-25072026.06 | 75.56 | 18,709 | 2.4 | |
| DEERModel=Qwen3-14B2026.06 | 70.42 | 11,454 | 17.4 | |
| VanillaModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 55.63 | 13,313 | — | |
| CUSUMModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 53.75 | 10,912 | 18 | |
| DynasorModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 52.67 | 11,215 | 15.8 | |
| DEERModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 46.67 | 10,756 | 19.2 |