Mathematical Reasoning on AIME 25 (ACC, A.Tok, epsilon^3)
36.67ACCR1-VeriThinker
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| R1-VeriThinkerBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 36.67 | 6,364.1 | 21 | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-7B, Same data and RL paradigm=true2026.05 | 36.67 | 7,998.13 | 17 | |
| VPG-EABackbone=DeepSeek-R1-Distill-Qwen-7B, Same data and RL paradigm=true2026.05 | 36.67 | 6,762.6 | 20 | |
| Original ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 33.33 | 10,355.1 | 11 | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 33.33 | 9,850.33 | 12 | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-7B, Same data and RL paradigm=true2026.05 | 30 | 6,852.53 | 13 | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Same data and RL paradigm=true2026.05 | 26.67 | 7,365.07 | 10 | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-7B, Same data and RL paradigm=true2026.05 | 26.67 | 5,944.73 | 12 | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Same data and RL paradigm=true2026.05 | 20 | 6,695.57 | 6 | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Same data and RL paradigm=true2026.05 | 20 | 7,602.73 | 5 | |
| VPG-EABackbone=DeepSeek-R1-Distill-Qwen-1.5B, Same data and RL paradigm=true2026.05 | 20 | 6,678.7 | 6 | |
| Original ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 16.67 | 12,845.3 | 2 | |
| ThinklessBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 16.67 | 7,661.17 | 4 | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 16.67 | 5,349.23 | 5 |