Mathematical Reasoning on AIME 25 (Acc, Tok)
71.3AccuracyOriginal
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OriginalModel Scale=Qwen3-4B-Thinking-2507, # Data=–2026.05 | 71.3 | 20,973 | |
| Budget PromptModel Scale=Qwen3-4B-Thinking-2507, # Data=–2026.05 | 71 | 20,362 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=1K2026.05 | 64.8 | 13,983 | |
| HINT TUNINGModel Scale=Qwen3-4B-Thinking-2507, # Data=1K2026.05 | 59.4 | 12,099 | |
| SFT-S1.1Model Scale=Qwen3-4B-Thinking-2507, # Data=1K2026.05 | 56 | 12,273 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=1K2026.05 | 53.3 | 14,104 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=–2026.05 | 51.7 | 13,051 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=1K2026.05 | 51 | 7,908 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=–2026.05 | 47.5 | 11,982 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=–2026.05 | 46.9 | 13,248 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=1K2026.05 | 46.6 | 8,430 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=–2026.05 | 45.6 | 12,339 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=1K2026.05 | 39.4 | 15,319 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=–2026.05 | 39 | 13,134 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=–2026.05 | 37.9 | 14,576 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=1K2026.05 | 37.7 | 9,144 | |
| AdaptThinkModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=40K†2026.05 | 36.9 | 12,063 | |
| EfficientRModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=3.2K†, Alpha=0.12026.05 | 35.4 | 11,902 | |
| VeriThinkerModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=340K2026.05 | 34.6 | 10,643 | |
| EfficientRModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=3.2K†, Alpha=0.42026.05 | 33.1 | 11,048 |