Mathematical Reasoning on Math Benchmarks Average
76.1Accuracy (ACC)GPT-5-Thinking*
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5-Thinking*Model Category=Closed-Source Models2026.04 | 76.1 | — | |
| Gemini-2.5-Pro*Model Category=Closed-Source Models2026.04 | 76 | — | |
| CERModel=Qwen3-8B2025.10 | 69.32 | 5,718.54 | |
| CCoTModel=Qwen3-8B2025.10 | 68.59 | 5,806.23 | |
| w thinkingModel=Qwen3-4B2025.10 | 67.83 | 7,317.59 | |
| CERModel=Qwen3-4B2025.10 | 67.78 | 5,470.29 | |
| w thinkingModel=Qwen3-8B2025.10 | 67.6 | 7,529.24 | |
| Graph-Based Chain-of-Thought PruningModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 60.95 | 4,660 | |
| CCoTModel=Qwen3-4B2025.10 | 60.81 | 5,821.54 | |
| AdaptThinkModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 60.15 | 5,972 | |
| BaseModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 59.72 | 8,134 | |
| EfficientReasoningModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 59.36 | 5,515 | |
| OREAL-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 58.8 | 6,983 | |
| Light-R1-DS-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 58.25 | 7,787 | |
| TokenSkipModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 55.99 | 6,964 | |
| AReaL-boba-RL-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 54.74 | 7,810 | |
| Skywork-OR1-7BModel Scale=7B, Method Variant=Open-Source R1-Style2026.04 | 54.52 | 7,958 | |
| O1-PrunerModel Scale=7B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 54.11 | 7,260 | |
| MUPO-Thinker-7BModel Category=Our Models2026.04 | 51.6 | — | |
| GSPO (G=8)Objective=GSPO, G (Rollouts per prompt)=8, Steps=300, Time=14.4h2026.05 | 50.2 | — | |
| Graph-Based Chain-of-Thought PruningModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 49.91 | 4,762 | |
| GSPO + REINFORCE++Objective=GSPO, G (Rollouts per prompt)=1, Steps=300, Time=13.0h2026.05 | 49.5 | — | |
| GPG (G=8)Objective=GPG, G (Rollouts per prompt)=8, Steps=300, Time=14.0h2026.05 | 49.2 | — | |
| Vision-R1-7BModel Category=Open-Source Models2026.04 | 49.1 | — | |
| CoDModel=Qwen3-4B2025.10 | 48.98 | 2,172.07 | |
| CoDModel=Qwen3-8B2025.10 | 48.8 | 2,293.45 | |
| EfficientReasoningModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 48.78 | 5,574 | |
| w/o thinkingModel=Qwen3-4B2025.10 | 48.59 | 1,435.86 | |
| GPG + BASISObjective=GPG, G (Rollouts per prompt)=1, Steps=150, Time=6.4h2026.05 | 48.3 | — | |
| GSPO + BASISObjective=GSPO, G (Rollouts per prompt)=1, Steps=150, Time=7.2h2026.05 | 48.1 | — | |
| w/o thinkingModel=Qwen3-8B2025.10 | 47.8 | 1,452.11 | |
| GRPO + BASISObjective=GRPO, G (Rollouts per prompt)=1, Steps=150, Time=8.3h2026.05 | 47.3 | — | |
| VLAA-Thinker-7BModel Category=Open-Source Models2026.04 | 47.2 | — | |
| GRPO (G=8)Objective=GRPO, G (Rollouts per prompt)=8, Steps=300, Time=15.5h2026.05 | 47.1 | — | |
| BaseModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 46.68 | 7,442 | |
| GPG + REINFORCE++Objective=GPG, G (Rollouts per prompt)=1, Steps=300, Time=12.9h2026.05 | 46.3 | — | |
| R1-OneVision-7BModel Category=Open-Source Models2026.04 | 46.1 | — | |
| AdaptThinkModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 46.09 | 2,806 | |
| GSPO VanillaObjective=GSPO, G (Rollouts per prompt)=1, Steps=300, Time=13.0h2026.05 | 45.8 | — | |
| GRPO + REINFORCE++Objective=GRPO, G (Rollouts per prompt)=1, Steps=300, Time=17.7h2026.05 | 43.1 | — | |
| MUPO-Thinker-3BModel Category=Our Models2026.04 | 43 | — | |
| InternVL2.5-8B*Model Category=Open-Source Models2026.04 | 41.7 | — | |
| TokenSkipModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 41.56 | 8,110 | |
| O1-PrunerModel Scale=1.5B, Backbone=DeepSeek-R1-Distill-Qwen2026.04 | 40.7 | 8,273 | |
| Qwen2.5-VL-7BModel Category=Open-Source Models2026.04 | 40.1 | — | |
| GPG VanillaObjective=GPG, G (Rollouts per prompt)=1, Steps=300, Time=18.6h2026.05 | 22.7 | — | |
| GRPO VanillaObjective=GRPO, G (Rollouts per prompt)=1, Steps=300, Time=20.7h2026.05 | 19.2 | — |