Mathematical Reasoning on GSM8K (Acc, Tokens, IRD, ERD, AES)
93.3AccuracyLaser-DE
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Laser-DEModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 93.3 | 637 | 68.2 | 31.1 | 32 | |
| ThinkPrune-4kModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 92.8 | 716 | 70.5 | 36 | 21 | |
| TrainingModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 91.2 | 387 | 65.1 | 14.6 | 54 | |
| BaselineModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 91.1 | 844 | 70 | 36 | — | |
| OursModel Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 90.9 | 318 | 51.8 | 6.5 | 61 | |
| LC-R1Model Scale=7B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 87.5 | 152 | 61.8 | 4.9 | 62 | |
| Laser-DEModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 86.4 | 971 | 74.3 | 37.5 | 46 | |
| ThinkPrune-4kModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 86.1 | 910 | 77.9 | 40.1 | 49 | |
| OursModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 84.9 | 513 | 49.6 | 5.7 | 70 | |
| BaselineModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 84.1 | 1,555 | 73.7 | 43 | — | |
| LC-R1Model Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 82.5 | 507 | 67.2 | 19.3 | 58 | |
| TrainingModel Scale=1.5B, Base Model=DeepSeek-R1-Distill-Qwen2025.08 | 81 | 292 | 61.6 | 7.8 | 63 | |
| ForaBest Ep=1.82026.06 | 46.87 | — | — | — | — | |
| L2-SPBest Ep=1.82026.06 | 46.69 | — | — | — | — | |
| FProjBest Ep=1.82026.06 | 46.66 | — | — | — | — | |
| EWCBest Ep=1.82026.06 | 46.6 | — | — | — | — | |
| WProjBest Ep=1.82026.06 | 46.46 | — | — | — | — | |
| Full FTBest Ep=1.82026.06 | 46.13 | — | — | — | — | |
| LwFBest Ep=2.82026.06 | 46.07 | — | — | — | — |