Mathematical Reasoning on AMC23 (ACC, LEN, NAG)
88.1AccuracyCEEH-EA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CEEH-EAExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 88.1 | 4,014 | -0.74 | |
| CEEH-MEExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 87.3 | 3,474 | -0.29 | |
| R1-Distill-Qwen2.5-7BReproduced=true2026.02 | 86.9 | 5,646 | — | |
| Dynasor-CoTExecution Strategy=Offline, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 85 | 5,980 | — | |
| DEERExecution Strategy=Offline, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 85 | 4,451 | 1.01 | |
| Length-PenaltyExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-7B, Reproduced=true2026.02 | 85 | 4,937 | 0.77 | |
| AutoThinkExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 83.3 | 4,645 | 1.74 | |
| LC-R1Execution Strategy=Online, Base Model=R1-Distill-Qwen2.5-7B2026.02 | 79.1 | 3,453 | 5.59 | |
| CEEH-MEExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-1.5B2026.02 | 72.6 | 5,078 | -6.64 | |
| CEEH-EAExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-1.5B2026.02 | 72.3 | 4,044 | -7.36 | |
| AutoThinkExecution Strategy=Online, Base Model=R1-Distill-Qwen2.5-1.5B2026.02 | 67 | 5,059 | -1.41 | |
| R1-Distill-Qwen2.5-1.5BReproduced=true2026.02 | 65.5 | 8,127 | — | |
| Qwen2.5-7B-MathExecution Strategy=Prompting2026.02 | 62.5 | 1,022 | 25.41 | |
| Qwen2.5-7B-Math-InsExecution Strategy=Prompting2026.02 | 60 | 1,029 | 27.99 | |
| LC-R1Execution Strategy=Online, Base Model=R1-Distill-Qwen2.5-1.5B2026.02 | 59 | 3,591 | 7.41 | |
| Qwen2.5-7B-InsExecution Strategy=Prompting2026.02 | 47.5 | 801 | 42 |