Mathematical Reasoning on Math500 (ACC, Avg Tokens)
97Accuracy (%)Base Model
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Base ModelBackbone=Qwen3-4B-Thinking-2507, #RL Steps=N/A2026.03 | 97 | — | 6,680 | |
| SmartThinkerBackbone=Qwen3-4B-Thinking-2507, #RL Steps=502026.03 | 96.6 | — | 3,488 | |
| LASER-DE-4096Backbone=DeepSeek-R1-Distill-Qwen-7B, #RL Steps=10002026.03 | 93.1 | — | 1,903 | |
| SmartThinkerBackbone=DeepSeek-R1-Distill-Qwen-7B, #RL Steps=752026.03 | 93 | — | 2,753 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-7B, #RL Steps=N/A2026.03 | 92.3 | — | 3,928 | |
| Qwen3-8BPruning strategy=None2025.08 | 91.37 | 7,138.49 | — | |
| Qwen3-8BPruning strategy=80% lowest-entropy steps2025.08 | 91.13 | 5,209.24 | — | |
| ShorterBetterBackbone=DeepSeek-R1-Distill-Qwen-7B, #RL Steps=2002026.03 | 88.5 | — | 1,346 | |
| DeepSeek-R1-7BPruning strategy=None2025.08 | 88.17 | 3,703.83 | — | |
| DeepSeek-R1-7BPruning strategy=80% lowest-entropy steps2025.08 | 88.17 | 2,604.23 | — | |
| LASER-DE-4096Backbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=10002026.03 | 85.1 | — | 2,720 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=N/A2026.03 | 84.9 | — | 5,420 | |
| SmartThinkerBackbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=1502026.03 | 84.5 | — | 2,645 | |
| DeepSeek-R1-14BPruning strategy=None2025.08 | 84.37 | 2,853.73 | — | |
| ThinkPrune-4kBackbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=N/A2026.03 | 84.1 | — | 2,744 | |
| DeepSeek-R1-14BPruning strategy=80% lowest-entropy steps2025.08 | 82.16 | 1,980.97 | — | |
| Truncated Think 8kBackbone=DeepSeek-R1-Distill-Qwen-7B, #RL Steps=N/A2026.03 | 75.2 | — | 3,421 | |
| Truncated Think 4kBackbone=DeepSeek-R1-Distill-Qwen-7B, #RL Steps=N/A2026.03 | 72.5 | — | 2,804 | |
| Truncated Think 8kBackbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=N/A2026.03 | 72 | — | 3,971 | |
| Truncated Think 4kBackbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=N/A2026.03 | 71.4 | — | 2,950 | |
| ShorterBetterBackbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=3002026.03 | 71 | — | 1,008 | |
| Truncated Think 4kBackbone=Qwen3-4B-Thinking-2507, #RL Steps=N/A2026.03 | 44.3 | — | 3,287 | |
| Truncated Think 8kBackbone=Qwen3-4B-Thinking-2507, #RL Steps=N/A2026.03 | 43 | — | 4,829 |