Mathematical Reasoning on Average (Math500, AIME25, AMC23)
13,040LengthBase Model
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Base ModelBackbone=Qwen3-4B-Thinking-2507, #RL Steps=N/A2026.03 | 13,040 | 88.5 | — | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=N/A2026.03 | 9,980 | 60.7 | — | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-7B, #RL Steps=N/A2026.03 | 8,463 | 73.1 | — | |
| SmartThinkerBackbone=Qwen3-4B-Thinking-2507, #RL Steps=502026.03 | 7,747 | 89 | 0.42 | |
| Truncated Think 8kBackbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=N/A2026.03 | 5,658 | 46.7 | -0.72 | |
| Truncated Think 8kBackbone=Qwen3-4B-Thinking-2507, #RL Steps=N/A2026.03 | 5,501 | 19.6 | -3.31 | |
| SmartThinkerBackbone=DeepSeek-R1-Distill-Qwen-7B, #RL Steps=752026.03 | 5,382 | 74.5 | 0.43 | |
| SmartThinkerBackbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=1502026.03 | 5,169 | 61.9 | 0.54 | |
| LASER-DE-4096Backbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=10002026.03 | 4,919 | 59.8 | 0.42 | |
| ThinkPrune-4kBackbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=N/A2026.03 | 4,802 | 60.95 | 0.53 | |
| Truncated Think 8kBackbone=DeepSeek-R1-Distill-Qwen-7B, #RL Steps=N/A2026.03 | 4,127 | 47.2 | -1.25 | |
| Truncated Think 4kBackbone=Qwen3-4B-Thinking-2507, #RL Steps=N/A2026.03 | 4,071 | 18.8 | -3.25 | |
| LASER-DE-4096Backbone=DeepSeek-R1-Distill-Qwen-7B, #RL Steps=10002026.03 | 3,809 | 71 | 0.41 | |
| Truncated Think 4kBackbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=N/A2026.03 | 3,625 | 41.9 | -0.91 | |
| Truncated Think 4kBackbone=DeepSeek-R1-Distill-Qwen-7B, #RL Steps=N/A2026.03 | 3,583 | 43 | -1.48 | |
| ShorterBetterBackbone=DeepSeek-R1-Distill-Qwen-7B, #RL Steps=2002026.03 | 3,491 | 68.3 | 0.26 | |
| ShorterBetterBackbone=DeepSeek-R1-Distill-Qwen-1.5B, #RL Steps=3002026.03 | 2,327 | 52.3 | 0.07 |