Mathematical Reasoning on MATH 500 (Acc, Tokens, IRD, ERD, AES)
92.1AccuracyLaser-DE
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Laser-DEModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 92.1 | 1,402 | 77 | 30.1 | 0.54 | |
| BaselineModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 91.2 | 2,836 | 78.1 | 51.6 | — | |
| TrainingModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 91 | 2,090 | 76.3 | 38.3 | 0.25 | |
| OursModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 89.8 | 1,200 | 58.7 | 6.1 | 0.5 | |
| ThinkPrune-4kModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 89.7 | 1,683 | 77.9 | 36.1 | 0.32 | |
| LC-R1Model Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 87.5 | 1,201 | 65.8 | 7 | 0.37 | |
| OursModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 83.8 | 1,505 | 51 | 7.9 | 0.63 | |
| ThinkPrune-4kModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 83.7 | 2,101 | 73.2 | 39.8 | 0.46 | |
| Laser-DEModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 83.6 | 2,282 | 78 | 36.3 | 0.41 | |
| TrainingModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 82.8 | 1,543 | 65.5 | 14.5 | 0.59 | |
| BaselineModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 82.2 | 3,549 | 77.5 | 55.2 | — | |
| LC-R1Model Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 79.6 | 1,673 | 75.8 | 22.5 | 0.37 |