Mathematical Reasoning on Minerva-Math (Acc, Len)
38.97AccuracyLCPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LCPOBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 38.97 | 2,079 | |
| TrEffBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 37.13 | 2,917 | |
| OriginalBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 36.76 | 5,926 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 36.4 | 2,733 | |
| L1-MaxBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 36.4 | 1,908 | |
| L1-ExactBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 36.03 | 3,341 | |
| DASTBackbone=DeepSeek-R1-Distill-Qwen-7B2025.08 | 36.03 | 8,119 | |
| L1-MaxBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 27.57 | 3,418 | |
| LCPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 27.21 | 2,596 | |
| OriginalBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 26.84 | 7,211 | |
| CoDBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 25.74 | 6,231 | |
| TrEffBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 25.74 | 2,950 | |
| L1-ExactBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.08 | 25.37 | 3,673 | |
| VRPOOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 20.22 | — | |
| GRPOOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 19.49 | — | |
| PPOOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 19.49 | — | |
| Cold StartOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 18.75 | — |