General Reasoning on MMLU-Pro (ACC, A.Tok, epsilon^3)
49.54ACCJET
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| JETBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 49.54 | 3,916.35 | 63 | |
| VPG-EABackbone=DeepSeek-R1-Distill-Qwen-7B, Trained with same data and RL paradigm=True2026.05 | 48.77 | 3,342.44 | 71 | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-7B, Trained with same data and RL paradigm=True2026.05 | 48.46 | 3,696.78 | 64 | |
| Original ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 47.53 | 4,115.27 | 55 | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-7B, Trained with same data and RL paradigm=True2026.05 | 44.77 | 4,270.04 | 47 | |
| R1-VeriThinkerBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 43.85 | 4,156.93 | 46 | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-7B, Trained with same data and RL paradigm=True2026.05 | 43.07 | 4,029.99 | 46 | |
| ThinklessBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 31.08 | 3,342.29 | 29 | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Trained with same data and RL paradigm=True2026.05 | 25.38 | 2,242.31 | 29 | |
| VPG-EABackbone=DeepSeek-R1-Distill-Qwen-1.5B, Trained with same data and RL paradigm=True2026.05 | 25.23 | 3,030.35 | 21 | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 25.08 | 2,928.34 | 21 | |
| Original ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 24.76 | 4,168.47 | 15 | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Trained with same data and RL paradigm=True2026.05 | 23.23 | 3,022.77 | 18 | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Trained with same data and RL paradigm=True2026.05 | 21.23 | 3,544.66 | 13 |