Mathematical Reasoning on AIME 24 (Acc, Tok)
77.9AccuracyOriginal
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OriginalModel Scale=Qwen3-4B-Thinking-2507, # Data=–2026.05 | 77.9 | 19,095 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=1K2026.05 | 77.3 | 11,383 | |
| Budget PromptModel Scale=Qwen3-4B-Thinking-2507, # Data=–2026.05 | 77.1 | 18,147 | |
| HINT TUNINGModel Scale=Qwen3-4B-Thinking-2507, # Data=1K2026.05 | 73.8 | 10,233 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=1K2026.05 | 69.8 | 12,483 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=–2026.05 | 69 | 11,061 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=1K2026.05 | 68.8 | 8,173 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=–2026.05 | 68.2 | 11,523 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=–2026.05 | 67.7 | 9,401 | |
| SFT-S1.1Model Scale=Qwen3-4B-Thinking-2507, # Data=1K2026.05 | 67.1 | 10,929 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=–2026.05 | 66 | 10,513 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=1K2026.05 | 63.3 | 7,963 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=1K2026.05 | 57.7 | 13,414 | |
| AdaptThinkModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=40K†2026.05 | 55 | 10,826 | |
| VeriThinkerModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=340K2026.05 | 54.6 | 10,031 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=–2026.05 | 53.8 | 12,959 | |
| EfficientRModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=3.2K†, Alpha=0.42026.05 | 53.5 | 10,336 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=1K2026.05 | 52.5 | 9,899 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=–2026.05 | 51.7 | 12,517 | |
| EfficientRModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=3.2K†, Alpha=0.12026.05 | 51.5 | 11,550 |