Mathematical Reasoning on AIME 2024 (Pass@1)
83.8Pass@1Qwen3-235B-A22B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-235B-A22BModel Category=Large Language Models, Thinking Mode=Thinking2025.12 | 83.8 | |
| Qwen3-32BModel Category=Large Language Models, Thinking Mode=Thinking2025.12 | 81.4 | |
| FIGRModel Category=Large Vision-Language Models2025.12 | 79.58 | |
| SPLAModel Size=14B, Temperature=0.6, Max output length=32k, Training context length=32k, Training tokens=1.2T, Sampling strategy=pass@12026.01 | 78.3 | |
| SPAModel Size=14B, Temperature=0.6, Max output length=32k, Training context length=32k, Training tokens=1.2T, Sampling strategy=pass@12026.01 | 77.2 | |
| Dense AttentionModel Size=14B, Temperature=0.6, Max output length=32k, Training context length=32k, Training tokens=1.2T, Sampling strategy=pass@12026.01 | 77.1 | |
| InfLLM-v2Model Size=14B, Temperature=0.6, Max output length=32k, Training context length=32k, Training tokens=1.2T, Sampling strategy=pass@12026.01 | 76.8 | |
| OpenMath-Nemotron-14B + iGRPOBase Model=OpenMath-Nemotron-14B, Training Method=iGRPO, Parameter Size=14B2026.02 | 76.72 | |
| OpenMath-Nemotron-14B + iGRPOBackbone=Nemotron-14B, Fine-tuning=iGRPO2026.02 | 76.61 | |
| GLM-4.5VModel Category=Large Vision-Language Models, Parameters=108B2025.12 | 76.2 | |
| OpenMath-Nemotron-7B + iGRPOBase Model=OpenMath-Nemotron-7B, Training Method=iGRPO, Parameter Size=7B2026.02 | 74.79 | |
| OpenMath-Nemotron-14B + GRPOBase Model=OpenMath-Nemotron-14B, Training Method=GRPO, Parameter Size=14B2026.02 | 74.79 | |
| OpenMath-Nemotron-7B + GRPOBase Model=OpenMath-Nemotron-7B, Training Method=GRPO, Parameter Size=7B2026.02 | 73.62 | |
| Qwen3-VL-32B-InstructModel Category=Large Vision-Language Models, Parameters=32B2025.12 | 73.33 | |
| Text-only RLModel Category=Large Vision-Language Models, Training=Reinforcement Learning (GRPO)2025.12 | 73.33 | |
| OpenMath-Nemotron-7BBase Model=OpenMath-Nemotron-7B, Parameter Size=7B2026.02 | 73.28 | |
| OpenMath-Nemotron-14BBase Model=OpenMath-Nemotron-14B, Parameter Size=14B2026.02 | 73.28 | |
| OpenMath-Nemotron-14BBackbone=Nemotron-14B2026.02 | 73.28 | |
| NSAModel Size=14B, Temperature=0.6, Max output length=32k, Training context length=32k, Training tokens=1.2T, Sampling strategy=pass@12026.01 | 73.1 | |
| DeepSeek-R1-Distill-Qwen-14B + iGRPOBase Model=DeepSeek-R1-Distill-Qwen-14B, Training Method=iGRPO, Parameter Size=14B2026.02 | 64.06 | |
| Qwen3-VL-8B-InstructModel Category=Large Vision-Language Models, Parameters=8B2025.12 | 61.46 | |
| DeepSeek-R1-Distill-Qwen-14B + GRPOBase Model=DeepSeek-R1-Distill-Qwen-14B, Training Method=GRPO, Parameter Size=14B2026.02 | 60.26 | |
| GC2POBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 59.1 | |
| DeepSeek-R1-Distill-Qwen-14BBase Model=DeepSeek-R1-Distill-Qwen-14B, Parameter Size=14B2026.02 | 58.93 | |
| L2T-GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 58.4 | |
| GCPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 58.3 | |
| GVPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 57.5 | |
| Dr.GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 57.4 | |
| ReST-MCTSBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 57.1 | |
| MRTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 57 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 56.9 | |
| DeepSeek-R1-Distill-Qwen-7B + iGRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=iGRPO, Parameter Size=7B2026.02 | 56.3 | |
| DeepSeek-R1-Distill-Qwen-7B + Self-VerificationBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=Self-Verification, Parameter Size=7B2026.02 | 55.8 | |
| DeepSeek-R1-Distill-Qwen-7B + Critique-GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=Critique-GRPO, Parameter Size=7B2026.02 | 55.65 | |
| DeepSeek-R1-Distill-Qwen-7BFine-tuning=None (Base Model)2026.02 | 55.5 | |
| DeepSeek-R1-Distill-Qwen-7B + GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=GRPO, Parameter Size=7B2026.02 | 55 | |
| DeepSeek-R1-Distill-Qwen-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Parameter Size=7B2026.02 | 54.4 | |
| length penaltyBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 53.8 | |
| SCOPEBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 52.7 | |
| GC2POBackbone=DeepScaleR-1.5B-Preview2026.02 | 49.3 | |
| L2T-GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 48.5 | |
| MRTBackbone=DeepScaleR-1.5B-Preview2026.02 | 47.2 | |
| TTRLBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 47.13 | |
| GCPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 46.7 | |
| GVPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 46.1 | |
| Dr.GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 45.8 | |
| ReST-MCTSBackbone=DeepScaleR-1.5B-Preview2026.02 | 45.5 | |
| GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 44.5 | |
| DeepScaleR-1.5B-PreviewFine-tuning=None (Base Model)2026.02 | 42.8 | |
| EVOL-RLBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 41.22 | |
| length penaltyBackbone=DeepScaleR-1.5B-Preview2026.02 | 40.3 | |
| GC2POBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 33.8 | |
| L2T-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 32.9 | |
| Qwen3-32BModel Category=Large Language Models, Thinking Mode=Non-Thinking2025.12 | 31 | |
| GCPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 31 | |
| GVPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 30.6 | |
| ReST-MCTSBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 30.5 | |
| Dr.GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 30.4 | |
| MRTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 30.3 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 29.8 | |
| DeepSeek-R1-Distill-Qwen-1.5BFine-tuning=None (Base Model)2026.02 | 28.7 | |
| CO-REWARDING-IBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 28.39 | |
| length penaltyBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 27.5 | |
| INTUITORBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 27.15 | |
| Qwen3-8BBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 26.45 | |
| SCOPEBackbone=Qwen2.5-Math-1.5B, Model Size Category=Lightweight-sized2025.12 | 22.5 | |
| SCOPEBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 21.66 | |
| TTRLBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 19.37 | |
| TTRLBackbone=Qwen2.5-Math-1.5B, Model Size Category=Lightweight-sized2025.12 | 16.48 | |
| CO-REWARDING-IBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 16.42 | |
| INTUITORBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 15.18 | |
| SCOPEBackbone=LLaMA3.1-8B-Instruct, Model Size Category=Medium-sized2025.12 | 14.37 | |
| RePOTraining Set=OpenR1-Math Hard Subset2026.02 | 13.1 | |
| Qwen2.5-Math-7BTraining Set=OpenR1-Math Hard Subset2026.02 | 11.5 | |
| Qwen3-1.7BBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 11.45 | |
| RLPRBackbone=LLaMA3.1-8B-Instruct, Model Size Category=Medium-sized2025.12 | 10 | |
| Nemotron-H-8B-Base-8K + iGRPOBase Model=Nemotron-H-8B-Base-8K, Training Method=iGRPO, Parameter Size=8B2026.02 | 9.56 | |
| TTRLBackbone=LLaMA3.1-8B-Instruct, Model Size Category=Medium-sized2025.12 | 9.56 | |
| Nemotron-H-8B-Base-8K + Self-VerificationBase Model=Nemotron-H-8B-Base-8K, Training Method=Self-Verification, Parameter Size=8B2026.02 | 9.25 | |
| Nemotron-H-8B-Base-8K + Critique-GRPOBase Model=Nemotron-H-8B-Base-8K, Training Method=Critique-GRPO, Parameter Size=8B2026.02 | 9.15 | |
| Nemotron-H-8B-Base-8K + GRPOBase Model=Nemotron-H-8B-Base-8K, Training Method=GRPO, Parameter Size=8B2026.02 | 9.01 | |
| Nemotron-H-8B-Base-8KBase Model=Nemotron-H-8B-Base-8K, Parameter Size=8B2026.02 | 8.65 | |
| Qwen2.5-Math-1.5BBackbone=Qwen2.5-Math-1.5B, Model Size Category=Lightweight-sized2025.12 | 7.92 | |
| INTUITORBackbone=Qwen2.5-Math-1.5B, Model Size Category=Lightweight-sized2025.12 | 6.88 | |
| LLaMA3.1-8B-InstructBackbone=LLaMA3.1-8B-Instruct, Model Size Category=Medium-sized2025.12 | 6.46 | |
| LUFFYTraining Set=OpenR1-Math Hard Subset2026.02 | 0 |