General Reasoning on GPQA Diamond (ACC, A.Tok, epsilon^3)
72.6AccuracyQwenLong L1.5-30B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| QwenLong L1.5-30BModel=QwenLong L1.5-30B2026.05 | 72.6 | — | — | |
| GoLongRL (w. GRPO)Model=Qwen3-30B-A3B-Thinking-2507, Optimization Method=GRPO2026.05 | 72.3 | — | — | |
| Qwen3-30B-A3B-Thinking-2507 BaseModel=Qwen3-30B-A3B-Thinking-2507, Optimization Method=Base2026.05 | 70.1 | — | — | |
| GoLongRL (w. TMN-Reweight)Model=Qwen3-4B-Thinking-2507, Optimization Method=TMN-Reweight2026.05 | 67.7 | — | — | |
| Qwen3-4B-Thinking-2507 BaseModel=Qwen3-4B-Thinking-2507, Optimization Method=Base2026.05 | 65.4 | — | — | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-7B, Trained with same data and RL paradigm=True2026.05 | 48.98 | 7,124.44 | 34 | |
| R-FewModel Backbone=Qwen3-8B-Base2026.06 | 46.5 | — | — | |
| INFUSERModel Backbone=Qwen3-8B-Base2026.06 | 45.48 | — | — | |
| AZRModel Backbone=Qwen3-8B-Base2026.06 | 44.14 | — | — | |
| R-ZeroModel Backbone=Qwen3-8B-Base2026.06 | 42.73 | — | — | |
| R-FewModel Backbone=Qwen3-4B-Base2026.06 | 39.9 | — | — | |
| SPICEModel Backbone=Qwen3-4B-Base2026.06 | 39.4 | — | — | |
| SPICEModel Backbone=Qwen3-8B-Base2026.06 | 39.4 | — | — | |
| VPG-EABackbone=DeepSeek-R1-Distill-Qwen-7B, Trained with same data and RL paradigm=True2026.05 | 38.88 | 3,892.62 | 39 | |
| AZRModel Backbone=Qwen3-4B-Base2026.06 | 37.17 | — | — | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 36.89 | 2,915.79 | 47 | |
| BaseModel Backbone=Qwen3-8B-Base2026.06 | 36.87 | — | — | |
| Original ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 36.86 | 6,471.26 | 21 | |
| R1-VeriThinkerBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 36.86 | 4,060.43 | 33 | |
| INFUSERModel Backbone=Qwen3-4B-Base2026.06 | 36.8 | — | — | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-7B, Trained with same data and RL paradigm=True2026.05 | 34.85 | 4,763.04 | 25 | |
| R-ZeroModel Backbone=Qwen3-4B-Base2026.06 | 34.44 | — | — | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-7B, Trained with same data and RL paradigm=True2026.05 | 33.83 | 3,603.66 | 32 | |
| ThinklessBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 32.82 | 7,465.22 | 14 | |
| BaseModel Backbone=Qwen3-4B-Base2026.06 | 31.41 | — | — | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Trained with same data and RL paradigm=True2026.05 | 30.8 | 6,695.57 | 14 | |
| VPG-EABackbone=DeepSeek-R1-Distill-Qwen-1.5B, Trained with same data and RL paradigm=True2026.05 | 30.8 | 6,237.98 | 15 | |
| Original ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 29.79 | 7,419.9 | 12 | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Trained with same data and RL paradigm=True2026.05 | 28.7 | 5,106.9 | 16 | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 26.77 | 6,140.98 | 12 | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Trained with same data and RL paradigm=True2026.05 | 26.77 | 5,768.08 | 12 |