General Reasoning on GPQA-Diamond & MMLU-Pro
57.6AccuracySORT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SORTBackbone=Qwen3-4B-Instruct2026.05 | 57.6 | — | — | 0.6 | |
| Qwen3-4B-InstructBackbone=Qwen3-4B-Instruct2026.05 | 57.6 | — | — | 0 | |
| GRPOBackbone=Qwen3-4B-Instruct2026.05 | 57 | — | — | 0.2 | |
| ReLIFTBackbone=Qwen3-4B-Instruct2026.05 | 56.8 | — | — | 0 | |
| LUFFYBackbone=Qwen3-4B-Instruct2026.05 | 56 | — | — | -13 | |
| Scaf-GRPOBackbone=Qwen3-4B-Instruct2026.05 | 53.6 | — | — | -1.4 | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-7B, Trained with same data and RL paradigm=True2026.05 | 48.72 | 5,410.61 | 0.49 | — | |
| VPG-EABackbone=DeepSeek-R1-Distill-Qwen-7B, Trained with same data and RL paradigm=True2026.05 | 43.83 | 3,617.53 | 0.55 | — | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 43.22 | 3,416.07 | 0.55 | — | |
| Original ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 42.2 | 5,293.27 | 0.38 | — | |
| R1-VeriThinkerBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 40.36 | 4,108.68 | 0.4 | — | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-7B, Trained with same data and RL paradigm=True2026.05 | 39.81 | 4,516.54 | 0.36 | — | |
| SORTBackbone=Qwen2.5-7B-Instruct2026.05 | 39.6 | — | — | 3.4 | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-7B, Trained with same data and RL paradigm=True2026.05 | 38.45 | 3,816.83 | 0.39 | — | |
| LUFFYBackbone=Qwen2.5-7B-Instruct2026.05 | 38.1 | — | — | 1.9 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.05 | 37.2 | — | — | 0.7 | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B-Instruct2026.05 | 37.1 | — | — | 0 | |
| Scaf-GRPOBackbone=Qwen2.5-7B-Instruct2026.05 | 36.6 | — | — | 0.8 | |
| ReLIFTBackbone=Qwen2.5-7B-Instruct2026.05 | 32.4 | — | — | -1.8 | |
| ThinklessBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 31.95 | 5,403.76 | 0.22 | — | |
| SFTBackbone=Qwen3-4B-Instruct2026.05 | 29.4 | — | — | -23.3 | |
| LaserBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Trained with same data and RL paradigm=True2026.05 | 28.09 | 4,468.94 | 0.22 | — | |
| VPG-EABackbone=DeepSeek-R1-Distill-Qwen-1.5B, Trained with same data and RL paradigm=True2026.05 | 28.02 | 4,634.17 | 0.18 | — | |
| Original ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 27.28 | 5,794.19 | 0.14 | — | |
| SORTBackbone=Llama-3.2-3B-Instruct2026.05 | 26.4 | — | — | 11.3 | |
| GRPOBackbone=Llama-3.2-3B-Instruct2026.05 | 26.3 | — | — | 10.6 | |
| AdaptThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Trained with same data and RL paradigm=True2026.05 | 25.97 | 4,064.84 | 0.17 | — | |
| JETBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 25.93 | 4,534.66 | 0.17 | — | |
| Scaf-GRPOBackbone=Llama-3.2-3B-Instruct2026.05 | 24.1 | — | — | 8.5 | |
| AutoThinkBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Trained with same data and RL paradigm=True2026.05 | 23.97 | 4,656.37 | 0.13 | — | |
| Llama-3.2-3B-InstructBackbone=Llama-3.2-3B-Instruct2026.05 | 17.9 | — | — | 0 | |
| LUFFYBackbone=Llama-3.2-3B-Instruct2026.05 | 16 | — | — | -1.1 | |
| ReLIFTBackbone=Llama-3.2-3B-Instruct2026.05 | 11.7 | — | — | -3.4 | |
| SFTBackbone=Llama-3.2-3B-Instruct2026.05 | 11.6 | — | — | -7.3 | |
| SFTBackbone=Qwen2.5-7B-Instruct2026.05 | 9.5 | — | — | -24.2 |