Mathematical Reasoning on AIME 24 (Acc, Tokens, IRD, ERD, AES)
53.2AccuracyOurs
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| OursModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 53.2 | 5,025 | 77.4 | 3.7 | 0.36 | |
| LC-R1Model Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 52.7 | 6,087 | 79.1 | 10.2 | 0.18 | |
| Laser-DEModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 52.7 | 5,061 | 80.5 | 11.8 | 0.32 | |
| BaselineModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 52.3 | 7,241 | 77.8 | 31.1 | — | |
| TrainingModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 50.8 | 6,669 | 78.8 | 23.1 | -0.06 | |
| ThinkPrune-4kModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 50.4 | 5,723 | 79.2 | 14.6 | 0.03 | |
| OursModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 34 | 6,077 | 72.5 | 10.9 | 0.88 | |
| Laser-DEModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 32.7 | 7,268 | 73.5 | 22.2 | 0.6 | |
| ThinkPrune-4kModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 28.6 | 6,431 | 75.2 | 21 | 0.27 | |
| BaselineModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 28.5 | 8,681 | 71.4 | 28.6 | — | |
| TrainingModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 28.5 | 7,049 | 73.2 | 17.4 | 0.21 | |
| LC-R1Model Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 24.2 | 5,075 | 79.6 | 20.4 | -0.34 |