Mathematical Reasoning on AIME 2024 (Accuracy, Length, and Length-Accuracy Metrics)
36.7AccuracyEffi. Reasoning
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Effi. ReasoningBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.06 | 36.7 | 5,771 | 19.9 | |
| DASTBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.06 | 36.7 | 5,400 | 21.4 | |
| kimi-k1.5Base Model=DeepSeek-R1-Distill-Qwen-1.5B2025.06 | 33.3 | 5,159 | 20.3 | |
| Bingo-ABase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.06 | 33.3 | 2,943 | 26.7 | |
| Bingo-EBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.06 | 33.3 | 2,943 | 26.7 | |
| DemystifyingBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.06 | 30 | 6,183 | 14.9 | |
| Vanilla PPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.06 | 26.7 | 6,961 | 10.3 | |
| O1-PrunerBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.06 | 26.7 | 5,958 | 13.9 |