Mathematical Reasoning on AIME 25 (Accuracy, Average generated tokens)
76.7AccuracyS1
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| S1Base Model=QwQ-32B2026.05 | 76.7 | 16,048 | |
| CyclicReflexBase Model=QwQ-32B2026.05 | 76.7 | 14,733 | |
| PathCalBase Model=QwQ-32B2026.05 | 70 | 15,989 | |
| OriginalBase Model=QwQ-32B2026.05 | 66.7 | 15,792 | |
| TIPBase Model=QwQ-32B2026.05 | 63.3 | 16,344 | |
| S1Base Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 40 | 7,020 | |
| PathCalBase Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 40 | 6,014 | |
| PathCalBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 36.7 | 5,051 | |
| TIPBase Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 36.7 | 6,696 | |
| OriginalBase Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 33.3 | 6,683 | |
| CyclicReflexBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 30 | 5,567 | |
| CyclicReflexBase Model=DeepSeek-R1-Distill-Qwen-14B2026.05 | 30 | 6,677 | |
| PathCalBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 30 | 6,202 | |
| OriginalBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 26.7 | 5,606 | |
| TIPBase Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 26.7 | 5,609 | |
| S1Base Model=DeepSeek-R1-Distill-Qwen-7B2026.05 | 26.7 | 6,035 | |
| TIPBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 26.7 | 6,562 | |
| CyclicReflexBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 26.7 | 6,424 | |
| OriginalBase Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 23.3 | 6,960 | |
| S1Base Model=DeepSeek-R1-Distill-Llama-8B2026.05 | 23.3 | 6,818 |