Mathematical Reasoning on OlympiadBench (Pass@1, # Tokens)
51.94Pass@1DeepScaleR-1.5B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DeepScaleR-1.5BBase Model=DeepScaleR-1.5B2026.02 | 51.94 | 5,410 | |
| GRPOBase Model=DeepScaleR-1.5B, Fine-tuning Algorithm=GRPO2026.02 | 49.11 | 3,418 | |
| LACONICBase Model=DeepScaleR-1.5B, Fine-tuning Algorithm=LACONIC, Length Budget (B)=20002026.02 | 48.96 | 2,448 | |
| ThinkPrune-Iter2kBase Model=DeepScaleR-1.5B, Fine-tuning Algorithm=ThinkPrune-Iter2k2026.02 | 48.77 | 2,935 | |
| Efficient-ReasoningBase Model=DeepScaleR-1.5B, Fine-tuning Algorithm=Efficient-Reasoning2026.02 | 46.95 | 3,230 | |
| L1-ExactBase Model=DeepScaleR-1.5B, Fine-tuning Algorithm=L1-Exact2026.02 | 44.91 | 3,987 | |
| DeepSeek-1.5BBase Model=DeepSeek-1.5B2026.02 | 44.8 | 12,417 | |
| L1-MaxBase Model=DeepScaleR-1.5B, Fine-tuning Algorithm=L1-Max2026.02 | 44.76 | 2,334 | |
| LACONICBase Model=DeepSeek-1.5B, Fine-tuning Algorithm=LACONIC, Length Budget (B)=15002026.02 | 44.11 | 3,241 | |
| GRPOBase Model=DeepSeek-1.5B, Fine-tuning Algorithm=GRPO2026.02 | 43.52 | 5,420 | |
| ThinkPrune-Iter2kBase Model=DeepSeek-1.5B, Fine-tuning Algorithm=ThinkPrune-Iter2k2026.02 | 43.39 | 3,021 | |
| Efficient-ReasoningBase Model=DeepSeek-1.5B, Fine-tuning Algorithm=Efficient-Reasoning2026.02 | 42.96 | 4,799 |