Math Reasoning on AIME 2025
56.1AccuracyExOPD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ExOPDDistillation Setting=Single-Teacher Distillation2026.02 | 56.1 | — | — | |
| ExOPDDistillation Setting=Multi-Teacher Distillation2026.02 | 56 | — | — | |
| ExPODistillation Setting=Single-Teacher Distillation2026.02 | 55.2 | — | — | |
| OPDDistillation Setting=Single-Teacher Distillation2026.02 | 55 | — | — | |
| TeacherDistillation Setting=Baseline2026.02 | 54.6 | — | — | |
| ExPODistillation Setting=Multi-Teacher Distillation2026.02 | 54.5 | — | — | |
| OPDDistillation Setting=Multi-Teacher Distillation2026.02 | 54.1 | — | — | |
| SFTDistillation Setting=Multi-Teacher Distillation2026.02 | 53.3 | — | — | |
| MCPO-DAPOBackbone=Qwen3-8B2026.05 | 51.44 | — | — | |
| MCPO-GRPOBackbone=Qwen3-8B2026.05 | 47.4 | — | — | |
| MGSBackbone=Qwen3-8B2026.05 | 45.32 | — | — | |
| DAPOBackbone=Qwen3-8B2026.05 | 45.2 | — | — | |
| MT-GRPOBackbone=Qwen3-8B2026.05 | 44.67 | — | — | |
| MCPO-DAPOBackbone=Qwen3-4B2026.05 | 44.58 | — | — | |
| GRPOBackbone=Qwen3-8B2026.05 | 43.67 | — | — | |
| CLIPOBackbone=Qwen3-8B2026.05 | 43.44 | — | — | |
| MCPO-GRPOBackbone=Qwen3-4B2026.05 | 43.23 | — | — | |
| DAPOBackbone=Qwen3-4B2026.05 | 40.34 | — | — | |
| MT-GRPOBackbone=Qwen3-4B2026.05 | 40.16 | — | — | |
| MGSBackbone=Qwen3-4B2026.05 | 39.38 | — | — | |
| DEPOModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 39.2 | 7,092 | 0.66 | |
| TLMREModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 39.2 | 8,301 | 0.55 | |
| GRPOBackbone=Qwen3-4B2026.05 | 39.1 | — | — | |
| CLIPOBackbone=Qwen3-4B2026.05 | 38.92 | — | — | |
| ATTNPOModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 38.1 | 5,359 | 0.72 | |
| Laser-DModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 38 | 6,167 | 0.64 | |
| Laser-DEModel Size=7B, Learning Paradigm=outcome-supervised RL2026.02 | 37.5 | 6,077 | 0.61 | |
| VSRM-R++Model Size=7B, Learning Paradigm=process-supervised RL2026.02 | 36.4 | 6,953 | 0.44 | |
| DECSModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 36.4 | 5,516 | 0.56 | |
| AutoThinkModel Size=7B, Learning Paradigm=adaptive-mode2026.02 | 36.2 | 8,608 | 0.27 | |
| AdaptThinkModel Size=7B, Learning Paradigm=adaptive-mode2026.02 | 36.2 | 9,523 | 0.19 | |
| LC-R1Model Size=7B, Learning Paradigm=process-supervised RL2026.02 | 36.2 | 7,150 | 0.4 | |
| S-GRPOModel Size=7B, Learning Paradigm=process-supervised RL2026.02 | 36 | 7,908 | 0.32 | |
| DS-7BModel Size=7B2026.02 | 35.8 | 11,307 | 0 | |
| Base ModelBackbone=Qwen3-8B2026.05 | 34.83 | — | — | |
| Base ModelBackbone=Qwen3-4B2026.05 | 33.75 | — | — | |
| TLMREModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 26.6 | 7,117 | 0.91 | |
| ATTNPOModel Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 25.4 | 5,488 | 0.89 | |
| DEPOModel Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 24.8 | 7,649 | 0.63 | |
| Laser-DEModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 24.2 | 7,323 | 0.58 | |
| DECSModel Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 23.8 | 4,965 | 0.72 | |
| Laser-DModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 23.1 | 6,928 | 0.47 | |
| AdaptThinkModel Size=1.5B, Learning Paradigm=adaptive-mode2026.02 | 23 | 7,255 | 0.43 | |
| VSRM-R++Model Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 22.9 | 6,892 | 0.45 | |
| DS-1.5BModel Size=1.5B2026.02 | 22.8 | 12,143 | 0 | |
| ThinkPruneModel Size=1.5B, Learning Paradigm=outcome-supervised RL2026.02 | 22.5 | 5,167 | 0.51 | |
| StudentDistillation Setting=Baseline2026.02 | 21.9 | — | — | |
| AutoThinkModel Size=1.5B, Learning Paradigm=adaptive-mode2026.02 | 21.8 | 7,944 | 0.13 | |
| LC-R1Model Size=1.5B, Learning Paradigm=process-supervised RL2026.02 | 21.2 | 6,434 | 0.12 | |
| SPICEModel Backbone=Qwen3-4B-Base2026.06 | 19.1 | — | — | |
| SPICEModel Backbone=Qwen3-8B-Base2026.06 | 18.2 | — | — | |
| INFUSERModel Backbone=Qwen3-8B-Base2026.06 | 15.87 | — | — | |
| AZRModel Backbone=Qwen3-8B-Base2026.06 | 14.17 | — | — | |
| AZRModel Backbone=Qwen3-4B-Base2026.06 | 13.75 | — | — | |
| R-ZeroModel Backbone=Qwen3-8B-Base2026.06 | 13.33 | — | — | |
| BaseModel Backbone=Qwen3-8B-Base2026.06 | 11.87 | — | — | |
| INFUSERModel Backbone=Qwen3-4B-Base2026.06 | 10.73 | — | — | |
| BaseModel Backbone=Qwen3-4B-Base2026.06 | 8.44 | — | — | |
| R-ZeroModel Backbone=Qwen3-4B-Base2026.06 | 7.19 | — | — |