Mathematical Reasoning on All Average
60AccuracyBudget Prompt
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Budget PromptModel Scale=Qwen3-4B-Thinking-2507, # Data=–2026.05 | 60 | 18,448 | |
| OriginalModel Scale=Qwen3-4B-Thinking-2507, # Data=–2026.05 | 59.3 | 19,699 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=1K2026.05 | 57.2 | 12,674 | |
| HINT TUNINGModel Scale=Qwen3-4B-Thinking-2507, # Data=1K2026.05 | 56.4 | 12,994 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=1K2026.05 | 51.8 | 13,344 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=–2026.05 | 51.6 | 12,737 | |
| SFT-S1.1Model Scale=Qwen3-4B-Thinking-2507, # Data=1K2026.05 | 51.4 | 11,911 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=1K2026.05 | 50.9 | 9,242 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=–2026.05 | 48.5 | 11,556 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=–2026.05 | 48.3 | 12,671 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-32B, # Data=–2026.05 | 48.3 | 10,671 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-14B, # Data=1K2026.05 | 48 | 8,850 | |
| SFT-S1.1Model Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=1K2026.05 | 43.4 | 13,772 | |
| Budget PromptModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=–2026.05 | 40.9 | 12,916 | |
| OriginalModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=–2026.05 | 40.7 | 13,786 | |
| AdaptThinkModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=40K†2026.05 | 40.7 | 11,256 | |
| HINT TUNINGModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=1K2026.05 | 40.7 | 9,027 | |
| VeriThinkerModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=340K2026.05 | 40.5 | 10,463 | |
| EfficientRModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=3.2K†, Alpha=0.12026.05 | 39.4 | 11,527 | |
| EfficientRModel Scale=DeepSeek-R1-Distill-Qwen-7B, # Data=3.2K†, Alpha=0.42026.05 | 39 | 10,950 |