Mathematical Reasoning on AIME 2024 (Accuracy)
93.33AccuracySTEP3-VL-10B (PaCoRe)
Evaluation Results
| Method | Links | |
|---|---|---|
| STEP3-VL-10B (PaCoRe)Reasoning Strategy=PaCoRe, Parameters=10B2026.01 | 93.33 | |
| Qwen3-VL (Thinking)Thinking Mode=true, Parameters=235B-A22B2026.01 | 91.93 | |
| STEP3-VL-10B (SeRe)Reasoning Strategy=SeRe, Parameters=10B2026.01 | 90.94 | |
| GLM-4.6VParameters=106B-A12B2026.01 | 80.63 | |
| Gemini-2.5 (Pro)Model Tier=Pro2026.01 | 79.53 | |
| Seed-1.5-VL (Thinking)Thinking Mode=true2026.01 | 79.48 | |
| QuestABackbone=OpenMath-Nemotron-1.5B, Sampling Strategy (@k)=@32, Dynamic Sampling=true, Training Steps=2000, Train Batch Size=128, Rollout N=16, Max Context Length=32k, Token Budget=2.6x10^8k2025.12 | 71.56 | |
| JustRL-NemotronBackbone=OpenMath-Nemotron-1.5B, Sampling Strategy (@k)=@32, Dynamic Sampling=false, Training Steps=3440, Train Batch Size=256, Rollout N=8, Max Context Length=16k, Token Budget=1.1x10^8k2025.12 | 69.69 | |
| Skill-centric distillation frameworkBase Model=Qwen3-4B, SFT Setting=1K2026.01 | 64.6 | |
| LIMOBase Model=Qwen3-4B, SFT Setting=1K, Data Selection Mode=offline2026.01 | 61.3 | |
| BaseBase Model=Qwen3-4B, SFT Setting=1K2026.01 | 61.1 | |
| s1Base Model=Qwen3-4B, SFT Setting=1K, Data Selection Mode=online2026.01 | 60.7 | |
| RandomBase Model=Qwen3-4B, SFT Setting=1K2026.01 | 60.1 | |
| BackboneBackbone=OpenMath-Nemotron-1.5B, Sampling Strategy (@k)=@322025.12 | 58.75 | |
| s1Base Model=Qwen3-4B, SFT Setting=1K, Data Selection Mode=offline2026.01 | 57.9 | |
| BroRLSampling strategy=@32, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 57.5 | |
| JustRL-DeepSeekSampling strategy=@32, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 52.6 | |
| ProRL-V2Sampling strategy=@32, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 51.87 | |
| DeepScaleR-1.5BSampling strategy=@32, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 40.21 | |
| PPCVModel=Qwen3-32B, Mode=non-thinking mode2026.02 | 40 | |
| Phi-DecodingModel=Qwen3-32B, Mode=non-thinking mode2026.02 | 33.6 | |
| Predictive DecodingModel=Qwen3-32B, Mode=non-thinking mode2026.02 | 32.67 | |
| Chain-of-ThoughtModel=Qwen3-32B, Mode=non-thinking mode2026.02 | 30 | |
| Backbone (DeepSeek-R1-Distill-Qwen-1.5B)Sampling strategy=@32, Backbone=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 29.9 | |
| Guided DecodingModel=Qwen3-32B, Mode=non-thinking mode2026.02 | 26.67 |