Mathematical Reasoning on AIME2024, MATH, Minerva, and Olympiad Benchmarks Aggregate
55Pass@1GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBackbone=Qwen3-8B2026.02 | 55 | 2,042 | |
| LACONICBackbone=Qwen3-8B, Target Tokens=10002026.02 | 52.23 | 1,096 | |
| L1-MaxBackbone=Qwen3-8B2026.02 | 51.58 | 1,192 | |
| DeepScaleR-1.5BBase Model=DeepScaleR-1.5B2026.02 | 51.06 | 5,176 | |
| LACONICBase Model=DeepScaleR-1.5B, Fine-tuning Algorithm=LACONIC, Length Budget (B)=20002026.02 | 50.28 | 2,462 | |
| L1-ExactBackbone=Qwen3-8B2026.02 | 50.08 | 1,170 | |
| ThinkPrune-Iter2kBase Model=DeepScaleR-1.5B, Fine-tuning Algorithm=ThinkPrune-Iter2k2026.02 | 49.71 | 2,819 | |
| GRPOBase Model=DeepScaleR-1.5B, Fine-tuning Algorithm=GRPO2026.02 | 48.4 | 3,484 | |
| Efficient-ReasoningBase Model=DeepScaleR-1.5B, Fine-tuning Algorithm=Efficient-Reasoning2026.02 | 47.19 | 3,277 | |
| DeepSeek-1.5BBase Model=DeepSeek-1.5B2026.02 | 46.71 | 9,940 | |
| L1-MaxBase Model=DeepScaleR-1.5B, Fine-tuning Algorithm=L1-Max2026.02 | 45.42 | 2,231 | |
| LACONICBase Model=DeepSeek-1.5B, Fine-tuning Algorithm=LACONIC, Length Budget (B)=15002026.02 | 44.63 | 2,914 | |
| L1-ExactBase Model=DeepScaleR-1.5B, Fine-tuning Algorithm=L1-Exact2026.02 | 44.56 | 3,904 | |
| GRPOBase Model=DeepSeek-1.5B, Fine-tuning Algorithm=GRPO2026.02 | 44.53 | 4,892 | |
| ThinkPrune-Iter2kBase Model=DeepSeek-1.5B, Fine-tuning Algorithm=ThinkPrune-Iter2k2026.02 | 43.85 | 3,015 | |
| Efficient-ReasoningBase Model=DeepSeek-1.5B, Fine-tuning Algorithm=Efficient-Reasoning2026.02 | 43.56 | 4,382 |