Mathematical Reasoning on AIME 24 (ACC, LEN, NAG)
54.8Accuracy (ACC)AutoThink
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AutoThinkExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 54.8 | 8,051 | -3.93 | |
| CEEH-MEExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 53.8 | 6,824 | -3.7 | |
| CEEH-EAExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 53.5 | 7,543 | -3 | |
| R1-Distill-Qwen2.5-7BReproduced=true2026.02 | 50.6 | 10,382 | — | |
| Length-PenaltyExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-7B, Reproduced=true2026.02 | 50.2 | 9,517 | 0.23 | |
| DEERExecution Strategy=Offline, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 49.2 | 9,839 | 0.63 | |
| ThinkSwitcherExecution Strategy=Offline, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 48.3 | 7,936 | 2.21 | |
| ConCISE-SimPOExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 48.3 | 7,745 | 2.29 | |
| Dynasor-CoTExecution Strategy=Offline, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 46.7 | 12,695 | 1.1 | |
| DASTExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 45.6 | 7,578 | 5.14 | |
| SpiritExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 38.3 | 6,926 | 14.02 | |
| AutoThinkExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-1.5B2026.02 | 34.6 | 9,514 | -11.63 | |
| CEEH-EAExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-1.5B2026.02 | 29.8 | 7,713 | -4.59 | |
| CEEH-MEExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-1.5B2026.02 | 28.5 | 8,511 | -1.58 | |
| R1-Distill-Qwen2.5-1.5BReproduced=true2026.02 | 27.7 | 12,164 | — | |
| Qwen2.5-7B-MathExecution Strategy=Prompting2026.02 | 19 | 1,429 | 57.99 | |
| Qwen2.5-7B-InsExecution Strategy=Prompting2026.02 | 12 | 1,016 | 72.46 | |
| Qwen2.5-7B-Math-InsExecution Strategy=Prompting2026.02 | 10.3 | 1,363 | 74.23 |