Mathematical Reasoning on HMMT25 (Accuracy and Token Count)
41.7AccuracyBudget Prompt
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Budget PromptModel Scale=Qwen3-4B-Thinking-2507, # Data=–2026.05 | 41.7 | 22,767 | |
| OriginalModel Scale=Qwen3-4B-Thinking-2507, # Data=–2026.05 | 39.4 | 24,376 | |
| HINT TUNINGModel Scale=Qwen3-4B-Thinking-2507, # Data=1K2026.05 | 32.7 | 14,523 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=1K2026.05 | 32.7 | 15,276 | |
| SFT-S1.1Model Scale=Qwen3-4B-Thinking-2507, # Data=1K2026.05 | 30.8 | 14,222 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=1K2026.05 | 30.4 | 15,836 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=–2026.05 | 26.9 | 14,813 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=1K2026.05 | 26.2 | 9,551 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=–2026.05 | 25.6 | 12,463 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=–2026.05 | 24.8 | 14,916 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=–2026.05 | 24.6 | 13,576 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=1K2026.05 | 23.8 | 10,010 | |
| AdaptThinkModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=40K†2026.05 | 19.8 | 13,873 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=1K2026.05 | 19 | 16,572 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=–2026.05 | 17.7 | 15,768 | |
| EfficientRModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=3.2K†, Alpha=0.42026.05 | 17.7 | 12,216 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=1K2026.05 | 17.7 | 9,629 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=–2026.05 | 16.7 | 16,339 | |
| EfficientRModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=3.2K†, Alpha=0.12026.05 | 15.4 | 13,184 | |
| VeriThinkerModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=340K2026.05 | 15.4 | 13,689 |