Chain-of-Thought Reasoning on Average AIME25 AIME24 GPQA-Diamond
74.32AccuracyVanilla
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VanillaModel=Qwen3-4B-Thinking-25072026.06 | 74.32 | 17,078 | — | |
| VanillaModel=Qwen3-14B2026.06 | 73.69 | 12,196 | — | |
| CUSUMModel=Qwen3-4B-Thinking-25072026.06 | 73.3 | 16,119 | 5.6 | |
| DEERModel=Qwen3-4B-Thinking-25072026.06 | 72.28 | 16,354 | 4.2 | |
| CUSUMModel=Qwen3-14B2026.06 | 71.45 | 10,838 | 11.1 | |
| DynasorModel=Qwen3-4B-Thinking-25072026.06 | 70.9 | 16,127 | 5.6 | |
| DynasorModel=Qwen3-14B2026.06 | 68.83 | 10,905 | 10.6 | |
| DEERModel=Qwen3-14B2026.06 | 67.1 | 10,944 | 10.3 | |
| VanillaModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 45.02 | 12,169 | — | |
| CUSUMModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 44.44 | 10,281 | 15.5 | |
| DEERModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 39.97 | 10,377 | 14.7 | |
| DynasorModel=DeepSeek-R1-Distill-Qwen-7B2026.06 | 36.37 | 10,793 | 11.3 |