Mathematical Reasoning on AIME 2025 (Pass@1)
80.78Pass@1Qwen3-235B-A22B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-235B-A22BModel Category=Large Language Models, Thinking Mode=Thinking2025.12 | 80.78 | |
| FIGRModel Category=Large Vision-Language Models2025.12 | 79.32 | |
| InfLLM-v2Model Size=14B, Temperature=0.6, Max output length=32k, Training context length=32k, Training tokens=1.2T, Sampling strategy=pass@12026.01 | 75.1 | |
| SPLAModel Size=14B, Temperature=0.6, Max output length=32k, Training context length=32k, Training tokens=1.2T, Sampling strategy=pass@12026.01 | 75.1 | |
| Dense AttentionModel Size=14B, Temperature=0.6, Max output length=32k, Training context length=32k, Training tokens=1.2T, Sampling strategy=pass@12026.01 | 73.9 | |
| SPAModel Size=14B, Temperature=0.6, Max output length=32k, Training context length=32k, Training tokens=1.2T, Sampling strategy=pass@12026.01 | 73 | |
| Qwen3-32BModel Category=Large Language Models, Thinking Mode=Thinking2025.12 | 72.9 | |
| Text-only RLModel Category=Large Vision-Language Models, Training=Reinforcement Learning (GRPO)2025.12 | 69.22 | |
| GLM-4.5VModel Category=Large Vision-Language Models, Parameters=108B2025.12 | 67.34 | |
| Qwen3-VL-32B-InstructModel Category=Large Vision-Language Models, Parameters=32B2025.12 | 66.2 | |
| OpenMath-Nemotron-14B + iGRPOBackbone=Nemotron-14B, Fine-tuning=iGRPO2026.02 | 66.04 | |
| OpenMath-Nemotron-14B + iGRPOBase Model=OpenMath-Nemotron-14B, Training Method=iGRPO, Parameter Size=14B2026.02 | 65.57 | |
| OpenMath-Nemotron-14B + GRPOBase Model=OpenMath-Nemotron-14B, Training Method=GRPO, Parameter Size=14B2026.02 | 64.53 | |
| NSAModel Size=14B, Temperature=0.6, Max output length=32k, Training context length=32k, Training tokens=1.2T, Sampling strategy=pass@12026.01 | 64.2 | |
| OpenMath-Nemotron-7B + iGRPOBase Model=OpenMath-Nemotron-7B, Training Method=iGRPO, Parameter Size=7B2026.02 | 62.45 | |
| OpenMath-Nemotron-7B + GRPOBase Model=OpenMath-Nemotron-7B, Training Method=GRPO, Parameter Size=7B2026.02 | 61.32 | |
| OpenMath-Nemotron-7BBase Model=OpenMath-Nemotron-7B, Parameter Size=7B2026.02 | 61.18 | |
| OpenMath-Nemotron-14BBase Model=OpenMath-Nemotron-14B, Parameter Size=14B2026.02 | 61.18 | |
| OpenMath-Nemotron-14BBackbone=Nemotron-14B2026.02 | 61.18 | |
| GC2POBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 54.3 | |
| L2T-GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 53.6 | |
| GCPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 53 | |
| ReST-MCTSBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 52.4 | |
| MRTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 52.4 | |
| Dr.GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 52.3 | |
| GVPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 52.1 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 51.7 | |
| DeepSeek-R1-Distill-Qwen-7BFine-tuning=None2026.02 | 50.2 | |
| length penaltyBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 46.9 | |
| Qwen3-VL-8B-InstructModel Category=Large Vision-Language Models, Parameters=8B2025.12 | 46.2 | |
| DeepSeek-R1-Distill-Qwen-14B + iGRPOBase Model=DeepSeek-R1-Distill-Qwen-14B, Training Method=iGRPO, Parameter Size=14B2026.02 | 45.52 | |
| DeepSeek-R1-Distill-Qwen-14B + GRPOBase Model=DeepSeek-R1-Distill-Qwen-14B, Training Method=GRPO, Parameter Size=14B2026.02 | 43.7 | |
| DeepSeek-R1-Distill-Qwen-14BBase Model=DeepSeek-R1-Distill-Qwen-14B, Parameter Size=14B2026.02 | 42.1 | |
| GC2POBackbone=DeepScaleR-1.5B-Preview2026.02 | 40.6 | |
| GCPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 40.3 | |
| L2T-GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 40.2 | |
| DeepSeek-R1-Distill-Qwen-7B + iGRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=iGRPO, Parameter Size=7B2026.02 | 40.16 | |
| GVPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 39.7 | |
| MRTBackbone=DeepScaleR-1.5B-Preview2026.02 | 39.7 | |
| DeepSeek-R1-Distill-Qwen-7B + Critique-GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=Critique-GRPO, Parameter Size=7B2026.02 | 39.6 | |
| Dr.GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 39.6 | |
| ReST-MCTSBackbone=DeepScaleR-1.5B-Preview2026.02 | 39.5 | |
| DeepSeek-R1-Distill-Qwen-7B + Self-VerificationBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=Self-Verification, Parameter Size=7B2026.02 | 39.45 | |
| GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 39.3 | |
| DeepSeek-R1-Distill-Qwen-7B + GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=GRPO, Parameter Size=7B2026.02 | 38.9 | |
| DeepSeek-R1-Distill-Qwen-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Parameter Size=7B2026.02 | 38.6 | |
| Composition-RLBackbone=Qwen3-14B-Base2026.02 | 36.9 | |
| DeepScaleR-1.5B-PreviewFine-tuning=None2026.02 | 36.7 | |
| SCOPEBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 31 | |
| GC2POBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 30.7 | |
| EVOL-RLBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 30.34 | |
| Composition-RLBackbone=Qwen3-30B-A3B-Base2026.02 | 30.3 | |
| length penaltyBackbone=DeepScaleR-1.5B-Preview2026.02 | 30.3 | |
| Standard RLVRBackbone=Qwen3-14B-Base2026.02 | 30.2 | |
| L2T-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 30.1 | |
| Composition-RLBackbone=Qwen3-4B-Base, Curriculum=Depth 1 + 2 + 32026.02 | 29.7 | |
| MRTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 29.3 | |
| GCPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 29 | |
| ReST-MCTSBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 28.6 | |
| Dr.GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 28.4 | |
| GVPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 28.2 | |
| Composition-RLBackbone=Qwen3-4B-Base, Curriculum=Depth 1 + 22026.02 | 27.8 | |
| TTRLBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 27.4 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 27.3 | |
| Composition-RLBackbone=Qwen3-8B-Base2026.02 | 26.5 | |
| INTUITORBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 26.19 | |
| DeepSeek-R1-Distill-Qwen-1.5BFine-tuning=None2026.02 | 26 | |
| Composition-RLBackbone=Qwen3-4B-Base2026.02 | 23.3 | |
| length penaltyBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 22.6 | |
| CO-REWARDING-IBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 21.74 | |
| Qwen3-8BBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 20.67 | |
| Standard RLVRBackbone=Qwen3-8B-Base2026.02 | 20.4 | |
| Qwen3-32BModel Category=Large Language Models, Thinking Mode=Non-Thinking2025.12 | 20.2 | |
| SCOPEBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 19.71 | |
| Standard RLVRBackbone=Qwen3-4B-Base2026.02 | 19.5 | |
| TTRLBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 19.23 | |
| Standard RLVRBackbone=Qwen3-30B-A3B-Base2026.02 | 16.2 | |
| SCOPEBackbone=Qwen2.5-Math-1.5B, Model Size Category=Lightweight-sized2025.12 | 14.9 | |
| CO-REWARDING-IBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 12.19 | |
| Qwen3-1.7BBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 11.53 | |
| INTUITORBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 11.42 | |
| RePOTraining Set=OpenR1-Math Hard Subset2026.02 | 10 | |
| TTRLBackbone=Qwen2.5-Math-1.5B, Model Size Category=Lightweight-sized2025.12 | 9.86 | |
| Nemotron-H-8B-Base-8K + iGRPOBase Model=Nemotron-H-8B-Base-8K, Training Method=iGRPO, Parameter Size=8B2026.02 | 9.17 | |
| Nemotron-H-8B-Base-8K + Self-VerificationBase Model=Nemotron-H-8B-Base-8K, Training Method=Self-Verification, Parameter Size=8B2026.02 | 8.5 | |
| Nemotron-H-8B-Base-8K + Critique-GRPOBase Model=Nemotron-H-8B-Base-8K, Training Method=Critique-GRPO, Parameter Size=8B2026.02 | 8.42 | |
| Nemotron-H-8B-Base-8K + GRPOBase Model=Nemotron-H-8B-Base-8K, Training Method=GRPO, Parameter Size=8B2026.02 | 7.78 | |
| Nemotron-H-8B-Base-8KBase Model=Nemotron-H-8B-Base-8K, Parameter Size=8B2026.02 | 6.2 | |
| INTUITORBackbone=Qwen2.5-Math-1.5B, Model Size Category=Lightweight-sized2025.12 | 5.5 | |
| Qwen2.5-Math-7BTraining Set=OpenR1-Math Hard Subset2026.02 | 4.9 | |
| Qwen2.5-Math-1.5BBackbone=Qwen2.5-Math-1.5B, Model Size Category=Lightweight-sized2025.12 | 3.12 | |
| SCOPEBackbone=LLaMA3.1-8B-Instruct, Model Size Category=Medium-sized2025.12 | 1.44 | |
| RLPRBackbone=LLaMA3.1-8B-Instruct, Model Size Category=Medium-sized2025.12 | 0.96 | |
| TTRLBackbone=LLaMA3.1-8B-Instruct, Model Size Category=Medium-sized2025.12 | 0.96 | |
| LLaMA3.1-8B-InstructBackbone=LLaMA3.1-8B-Instruct, Model Size Category=Medium-sized2025.12 | 0 | |
| LUFFYTraining Set=OpenR1-Math Hard Subset2026.02 | 0 |