Mathematical Reasoning on MATH 500 (ACC, A.Tok, epsilon^3)
93Accuracy (ACC)VPG-EA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VPG-EABackbone=DeepSeek-R1-Distill-Qwen-7B, Same data and RL paradigm=true2026.05 | 93 | 1,626.01 | 5.32 | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-7B, Same data and RL paradigm=true2026.05 | 92.6 | 1,705.36 | 5.03 | |
| Original ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 91 | 2,336.1 | 3.54 | |
| R1-VeriThinkerBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 91 | 1,726.2 | 4.8 | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-7B, Same data and RL paradigm=true2026.05 | 89.6 | 2,028.86 | 3.96 | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 88.2 | 1,840.3 | 4.23 | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-7B, Same data and RL paradigm=true2026.05 | 87 | 1,945.81 | 3.89 | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 83.8 | 2,397.6 | 2.93 | |
| VPG-EABackbone=DeepSeek-R1-Distill-Qwen-1.5B, Same data and RL paradigm=true2026.05 | 82.4 | 1,891.8 | 3.59 | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Same data and RL paradigm=true2026.05 | 81.6 | 1,911.5 | 3.2 | |
| ThinklessBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 81.2 | 1,936.46 | 3.4 | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Same data and RL paradigm=true2026.05 | 79.2 | 1,960.2 | 3.2 | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Same data and RL paradigm=true2026.05 | 79 | 1,845.33 | 3.38 | |
| Original ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 75 | 3,098.02 | 1.82 |