Mathematical Reasoning on AIME24 (ACC, A.Tok, epsilon^3)
56.67Accuracy (ACC)VPG-EA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VPG-EABackbone=DeepSeek-R1-Distill-Qwen-7B, Same data and RL paradigm=true2026.05 | 56.67 | 6,152.83 | 0.52 | |
| Original ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 53.33 | 8,208.73 | 0.35 | |
| R1-VeriThinkerBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 53.33 | 6,127.47 | 0.46 | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 43.33 | — | — | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-7B, Same data and RL paradigm=true2026.05 | 43.33 | 8,044.07 | 0.23 | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-7B, Same data and RL paradigm=true2026.05 | 40 | 4,877.27 | 0.33 | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-7B, Same data and RL paradigm=true2026.05 | 40 | 6,125.5 | 0.26 | |
| VPG-EABackbone=DeepSeek-R1-Distill-Qwen-1.5B, Same data and RL paradigm=true2026.05 | 33.33 | 6,659.73 | 0.17 | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 26.67 | 6,159.3 | 0.12 | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Same data and RL paradigm=true2026.05 | 26.67 | 8,457.9 | 0.08 | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Same data and RL paradigm=true2026.05 | 26.67 | 6,325.2 | 0.11 | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Same data and RL paradigm=true2026.05 | 23.33 | 7,596.63 | 0.07 | |
| Original ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 20 | 11,524.67 | 0.03 | |
| ThinklessBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 20 | 7,004.4 | 0.06 |