Mathematical Reasoning on AMC (Pass@1)
97.5Pass@1OpenMath-Nemotron-7B + iGRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| OpenMath-Nemotron-7B + iGRPOBase Model=OpenMath-Nemotron-7B, Training Method=iGRPO, Parameter Size=7B2026.02 | 97.5 | |
| OpenMath-Nemotron-14B + iGRPOBase Model=OpenMath-Nemotron-14B, Training Method=iGRPO, Parameter Size=14B2026.02 | 97.5 | |
| OpenMath-Nemotron-14B + iGRPOBackbone=Nemotron-14B, Fine-tuning=iGRPO2026.02 | 97.5 | |
| DeepSeek-R1-Distill-Qwen-7B + iGRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=iGRPO, Parameter Size=7B2026.02 | 95 | |
| OpenMath-Nemotron-7BBase Model=OpenMath-Nemotron-7B, Parameter Size=7B2026.02 | 95 | |
| OpenMath-Nemotron-7B + GRPOBase Model=OpenMath-Nemotron-7B, Training Method=GRPO, Parameter Size=7B2026.02 | 95 | |
| OpenMath-Nemotron-14BBase Model=OpenMath-Nemotron-14B, Parameter Size=14B2026.02 | 95 | |
| OpenMath-Nemotron-14B + GRPOBase Model=OpenMath-Nemotron-14B, Training Method=GRPO, Parameter Size=14B2026.02 | 95 | |
| OpenMath-Nemotron-14BBackbone=Nemotron-14B2026.02 | 95 | |
| Qwen3-235B-A22BModel Category=Large Language Models, Thinking Mode=Thinking2025.12 | 93.98 | |
| Qwen3-32BModel Category=Large Language Models, Thinking Mode=Thinking2025.12 | 93.98 | |
| FIGRModel Category=Large Vision-Language Models2025.12 | 93.98 | |
| DeepSeek-R1-Distill-Qwen-14B + iGRPOBase Model=DeepSeek-R1-Distill-Qwen-14B, Training Method=iGRPO, Parameter Size=14B2026.02 | 93.45 | |
| DeepSeek-R1-Distill-Qwen-7B + Critique-GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=Critique-GRPO, Parameter Size=7B2026.02 | 92.8 | |
| DeepSeek-R1-Distill-Qwen-7B + Self-VerificationBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=Self-Verification, Parameter Size=7B2026.02 | 92.5 | |
| DeepSeek-R1-Distill-Qwen-14B + GRPOBase Model=DeepSeek-R1-Distill-Qwen-14B, Training Method=GRPO, Parameter Size=14B2026.02 | 91.2 | |
| DeepSeek-R1-Distill-Qwen-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Parameter Size=7B2026.02 | 90 | |
| DeepSeek-R1-Distill-Qwen-7B + GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=GRPO, Parameter Size=7B2026.02 | 90 | |
| DeepSeek-R1-Distill-Qwen-14BBase Model=DeepSeek-R1-Distill-Qwen-14B, Parameter Size=14B2026.02 | 90 | |
| GRPOtraining_data=SuperGPQA subset (11k)2026.02 | 89.3 | |
| Qwen3-8Btraining_data=SuperGPQA subset (11k)2026.02 | 88.9 | |
| RePOtraining_data=SuperGPQA subset (11k)2026.02 | 88.6 | |
| GLM-4.5VModel Category=Large Vision-Language Models, Parameters=108B2025.12 | 87.95 | |
| Text-only RLModel Category=Large Vision-Language Models, Training=Reinforcement Learning (GRPO)2025.12 | 87.95 | |
| LUFFYtraining_data=SuperGPQA subset (11k)2026.02 | 87.9 | |
| SATURN-7BModel Scale=7B2026.01 | 85.42 | |
| Thinker-7BModel Scale=7B2026.01 | 85.09 | |
| Qwen3-VL-32B-InstructModel Category=Large Vision-Language Models, Parameters=32B2025.12 | 84.34 | |
| R³-7BModel Scale=7B2026.01 | 84.18 | |
| Qwen3-VL-8B-InstructModel Category=Large Vision-Language Models, Parameters=8B2025.12 | 81.93 | |
| DeepSeek-R1-Distill-Qwen-7BModel Scale=7B2026.01 | 80.19 | |
| R³-1.5BModel Scale=1.5B2026.01 | 77.33 | |
| FASTCURL-1.5B-V2Model Scale=1.5B2026.01 | 77.01 | |
| SCOPEBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 74.09 | |
| SimpleRL-7BModel Scale=7B2026.01 | 73.56 | |
| DeepScaleR-1.5B-PreviewModel Scale=1.5B2026.01 | 72.89 | |
| CO-REWARDING-IBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 71.39 | |
| EVOL-RLBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 69.62 | |
| TTRLBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 68.55 | |
| STILL-3-1.5BModel Scale=1.5B2026.01 | 66.11 | |
| INTUITORBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 65.66 | |
| GRPOBackbone=Qwen, Model Size=7B2026.01 | 65 | |
| AEROBackbone Model=Qwen3-8B-Base, Evolutionary Round=R52026.02 | 62.7 | |
| Absolute ZeroBackbone Model=Qwen3-8B-Base2026.02 | 62.5 | |
| R-ZeroBackbone Model=Qwen3-8B-Base2026.02 | 61.7 | |
| Qwen3-32BModel Category=Large Language Models, Thinking Mode=Non-Thinking2025.12 | 61.45 | |
| DeepSeek-R1-Distill-Qwen-1.5BModel Scale=1.5B2026.01 | 61.21 | |
| AEROBackbone Model=Qwen3-8B-Base, Evolutionary Round=R42026.02 | 61.2 | |
| GRPOBackbone=Qwen, Model Size=1.5B2026.01 | 60 | |
| Progressive Thought EncodingBackbone Model=DeepSeek-R1-Distill-Llama-8B, Maximum TFLOPs of Attention=4.6, Peak GPU Mem. (%)=59.8, Mean GPU Mem. (%)=46.82026.02 | 60 | |
| AEROBackbone Model=Qwen3-8B-Base, Evolutionary Round=R32026.02 | 59.7 | |
| Qwen3-8BBackbone=Qwen3-8B, Model Size Category=Medium-sized2025.12 | 59.5 | |
| DoPRBackbone=Qwen, Model Size=1.5B2026.01 | 59.3 | |
| UFOBackbone=Qwen, Model Size=1.5B2026.01 | 59.2 | |
| Eurus-2-7B-PrimeModel Scale=7B2026.01 | 57.84 | |
| AEROBackbone Model=Qwen3-8B-Base, Evolutionary Round=R22026.02 | 56.7 | |
| One-Shot RLBackbone=Qwen, Model Size=1.5B2026.01 | 55.2 | |
| LoRABackbone Model=DeepSeek-R1-Distill-Llama-8B, Maximum TFLOPs of Attention=7.4, Peak GPU Mem. (%)=88.7, Mean GPU Mem. (%)=53.52026.02 | 55 | |
| AEROBackbone Model=Qwen3-4B-Base, Evolutionary Round=R52026.02 | 54.5 | |
| AEROBackbone Model=Qwen3-8B-Base, Evolutionary Round=R12026.02 | 54.5 | |
| SCOPEBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 53.46 | |
| AEROBackbone Model=Qwen3-4B-Base, Evolutionary Round=R42026.02 | 53 | |
| UFOBackbone=Qwen, Model Size=7B2026.01 | 52.8 | |
| One-Shot RLBackbone=Qwen, Model Size=7B2026.01 | 52.5 | |
| DoPRBackbone=Qwen, Model Size=7B2026.01 | 52.5 | |
| LoRAcBackbone Model=Qwen2.5-7B-Instruct, Maximum TFLOPs of Attention=3.5, Peak GPU Mem. (%)=63.1, Mean GPU Mem. (%)=45.42026.02 | 52.5 | |
| Progressive Thought EncodingBackbone Model=Qwen2.5-7B-Instruct, Maximum TFLOPs of Attention=3.6, Peak GPU Mem. (%)=67.2, Mean GPU Mem. (%)=48.62026.02 | 52.5 | |
| Qwen3-8B-BaseBackbone Model=Qwen3-8B-Base2026.02 | 52 | |
| CO-REWARDING-IBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 51.99 | |
| AEROBackbone Model=Qwen3-4B-Base, Evolutionary Round=R32026.02 | 51.5 | |
| SCOPEBackbone=Qwen2.5-Math-1.5B, Model Size Category=Lightweight-sized2025.12 | 51.2 | |
| Qwen2.5-Math-7B-InstructModel Scale=7B2026.01 | 50.62 | |
| LoRABackbone Model=Qwen2.5-7B-Instruct, Maximum TFLOPs of Attention=5.7, Peak GPU Mem. (%)=85.8, Mean GPU Mem. (%)=59.32026.02 | 50.6 | |
| TTRLBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 50.45 | |
| Absolute ZeroBackbone Model=Qwen3-4B-Base2026.02 | 50 | |
| AEROBackbone Model=Qwen3-4B-Base, Evolutionary Round=R12026.02 | 49.3 | |
| TTRLBackbone=Qwen2.5-Math-1.5B, Model Size Category=Lightweight-sized2025.12 | 48.87 | |
| Nemotron-H-8B-Base-8K + iGRPOBase Model=Nemotron-H-8B-Base-8K, Training Method=iGRPO, Parameter Size=8B2026.02 | 48.75 | |
| RePOTraining Set=OpenR1-Math Hard Subset2026.02 | 48.5 | |
| BaselineBackbone Model=Qwen2.5-7B-Instruct2026.02 | 48.4 | |
| R-ZeroBackbone Model=Qwen3-4B-Base2026.02 | 48.2 | |
| Rstar-Math-7BModel Scale=7B2026.01 | 47.51 | |
| Qwen3-4B-BaseBackbone Model=Qwen3-4B-Base2026.02 | 47.5 | |
| Nemotron-H-8B-Base-8K + Critique-GRPOBase Model=Nemotron-H-8B-Base-8K, Training Method=Critique-GRPO, Parameter Size=8B2026.02 | 46.8 | |
| AEROBackbone Model=Qwen3-4B-Base, Evolutionary Round=R22026.02 | 46.7 | |
| Nemotron-H-8B-Base-8K + Self-VerificationBase Model=Nemotron-H-8B-Base-8K, Training Method=Self-Verification, Parameter Size=8B2026.02 | 46.5 | |
| INTUITORBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 45.58 | |
| Nemotron-H-8B-Base-8K + GRPOBase Model=Nemotron-H-8B-Base-8K, Training Method=GRPO, Parameter Size=8B2026.02 | 45.1 | |
| Qwen2.5-baseModel Size=7B, RL Strategy=Base2026.01 | 45 | |
| Progressive Thought EncodingBackbone Model=Qwen2.5-3B-Instruct, Maximum TFLOPs of Attention=2.7, Peak GPU Mem. (%)=45.3, Mean GPU Mem. (%)=32.62026.02 | 45 | |
| LoRAcBackbone Model=DeepSeek-R1-Distill-Llama-8B, Maximum TFLOPs of Attention=4.6, Peak GPU Mem. (%)=59.1, Mean GPU Mem. (%)=47.12026.02 | 45 | |
| Nemotron-H-8B-Base-8KBase Model=Nemotron-H-8B-Base-8K, Parameter Size=8B2026.02 | 43.21 | |
| Qwen2.5-Math-baseModel Size=7B, RL Strategy=Base2026.01 | 42.5 | |
| BaselineBackbone Model=DeepSeek-R1-Distill-Llama-8B2026.02 | 42.5 | |
| Qwen3-1.7BBackbone=Qwen3-1.7B, Model Size Category=Lightweight-sized2025.12 | 39.3 | |
| INTUITORBackbone=Qwen2.5-Math-1.5B, Model Size Category=Lightweight-sized2025.12 | 39.08 | |
| LoRABackbone Model=Qwen2.5-3B-Instruct, Maximum TFLOPs of Attention=4.2, Peak GPU Mem. (%)=82.8, Mean GPU Mem. (%)=63.52026.02 | 35.9 | |
| SCOPEBackbone=LLaMA3.1-8B-Instruct, Model Size Category=Medium-sized2025.12 | 35.24 | |
| BaselineBackbone Model=Qwen2.5-3B-Instruct2026.02 | 34.3 | |
| LoRAcBackbone Model=Qwen2.5-3B-Instruct, Maximum TFLOPs of Attention=2.6, Peak GPU Mem. (%)=38, Mean GPU Mem. (%)=312026.02 | 33.1 |