Mathematical Reasoning on MATH 500
97.3pass@1r1
Evaluation Results
| Method | Links | |
|---|---|---|
| r1Availability=Open Weights, Reasoning finetuning examples (# ex.)=≫800K2026.03 | 97.3 | |
| OpenMath-Nemotron-14B + iGRPOBackbone=Nemotron-14B, Fine-tuning=iGRPO2026.02 | 96.9 | |
| OpenMath-Nemotron-14B + iGRPOBase Model=OpenMath-Nemotron-14B, Training Method=iGRPO, Parameter Size=14B2026.02 | 96.7 | |
| Qwen3-8Btraining_data=SuperGPQA subset (11k)2026.02 | 96.2 | |
| OpenMath-Nemotron-7B + iGRPOBase Model=OpenMath-Nemotron-7B, Training Method=iGRPO, Parameter Size=7B2026.02 | 96 | |
| OpenMath-Nemotron-14B + GRPOBase Model=OpenMath-Nemotron-14B, Training Method=GRPO, Parameter Size=14B2026.02 | 96 | |
| OpenMath-Nemotron-7B + GRPOBase Model=OpenMath-Nemotron-7B, Training Method=GRPO, Parameter Size=7B2026.02 | 95.6 | |
| OpenMath-Nemotron-7BBase Model=OpenMath-Nemotron-7B, Parameter Size=7B2026.02 | 95.55 | |
| OpenMath-Nemotron-14BBase Model=OpenMath-Nemotron-14B, Parameter Size=14B2026.02 | 95.55 | |
| OpenMath-Nemotron-14BBackbone=Nemotron-14B2026.02 | 95.55 | |
| GRPOtraining_data=SuperGPQA subset (11k)2026.02 | 94.8 | |
| RePOtraining_data=SuperGPQA subset (11k)2026.02 | 94.8 | |
| o1Availability=API only, Reasoning finetuning examples (# ex.)=N.A.2026.03 | 94.8 | |
| Sigma-MoE-TinyArchitecture=MoE, # Activated Params=0.5B, # Total Params=20B2025.12 | 94.6 | |
| DeepSeek-R1-Distill-Llama-70BArchitecture=Llama, Parameter count=70B2025.01 | 94.5 | |
| DeepSeek-R1-Distill-Qwen-32BArchitecture=Qwen, Parameter count=32B2025.01 | 94.3 | |
| r1-distillAvailability=Open Weights, Reasoning finetuning examples (# ex.)=800K2026.03 | 94.3 | |
| DeepSeek-R1-Distill-Qwen-14B + iGRPOBase Model=DeepSeek-R1-Distill-Qwen-14B, Training Method=iGRPO, Parameter Size=14B2026.02 | 94 | |
| LUFFYtraining_data=SuperGPQA subset (11k)2026.02 | 94 | |
| DeepSeek-R1-Distill-Qwen-14BArchitecture=Qwen, Parameter count=14B2025.01 | 93.9 | |
| DeepSeek-R1-Distill-Qwen-7B + iGRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=iGRPO, Parameter Size=7B2026.02 | 93.8 | |
| DeepSeek-R1-Distill-Qwen-7B + Self-VerificationBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=Self-Verification, Parameter Size=7B2026.02 | 93.5 | |
| DeepSeek-R1-Distill-Qwen-7B + Critique-GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=Critique-GRPO, Parameter Size=7B2026.02 | 93.45 | |
| Qwen3-1.7BArchitecture=Dense, # Activated Params=1.7B, # Total Params=1.7B2025.12 | 93.4 | |
| DeepSeek-R1-Distill-Qwen-7B + GRPOBase Model=DeepSeek-R1-Distill-Qwen-7B, Training Method=GRPO, Parameter Size=7B2026.02 | 93.25 | |
| PCLBackbone=DeepSeek-R1-Distill-7B, Strategy=PCL, Runtime=50h2026.02 | 93.2 | |
| Dynamic Sampling (Oracle)Backbone=DeepSeek-R1-Distill-7B, Strategy=DS, Runtime=77h2026.02 | 93.2 | |
| GPSBackbone=DeepSeek-R1-Distill-7B, Strategy=GPS, Runtime=49h2026.02 | 93.2 | |
| DeepSeek-R1-Distill-Qwen-14BBase Model=DeepSeek-R1-Distill-Qwen-14B, Parameter Size=14B2026.02 | 93.1 | |
| DeepSeek-R1-Distill-Qwen-14B + GRPOBase Model=DeepSeek-R1-Distill-Qwen-14B, Training Method=GRPO, Parameter Size=14B2026.02 | 93.1 | |
| Bespoke-32BAvailability=Open Weights and Open Data, Reasoning finetuning examples (# ex.)=17K2026.03 | 93 | |
| DeepSeek-R1-Distill-Qwen-7BArchitecture=Qwen, Parameter count=7B2025.01 | 92.8 | |
| DeepSeek-R1-Distill-Qwen-7BBase Model=DeepSeek-R1-Distill-Qwen-7B, Parameter Size=7B2026.02 | 92.8 | |
| DeepSeek-R1-Distill-Qwen-7BArchitecture=Dense, # Activated Params=7B, # Total Params=7B2025.12 | 92.8 | |
| s1-32BAvailability=Open Weights and Open Data, Reasoning finetuning examples (# ex.)=1K2026.03 | 92.6 | |
| MoPPSBackbone=DeepSeek-R1-Distill-7B, Strategy=MoPPS, Runtime=42h2026.02 | 92 | |
| THINKSAFEModel Size=7B, Sampling trajectories=82026.01 | 91.9 | |
| GRESOBackbone=DeepSeek-R1-Distill-7B, Strategy=GRESO, Runtime=53h2026.02 | 91.8 | |
| Uniform SamplingBackbone=DeepSeek-R1-Distill-7B, Strategy=Uniform, Runtime=40h2026.02 | 91.6 | |
| SafeChainModel Size=7B, Sampling trajectories=82026.01 | 91.5 | |
| SafePathModel Size=7B, Sampling trajectories=82026.01 | 90.62 | |
| HEALModels=Qwen2.5-14B-Instruct2026.03 | 90.62 | |
| QwQ-32BAvailability=Open Weights, Reasoning finetuning examples (# ex.)=N.A.2026.03 | 90.6 | |
| STAR-1Model Size=7B, Sampling trajectories=82026.01 | 90.58 | |
| MulFeRLBackbone=Qwen3-4B-Inst, Training Strategy=Multi-turn Feedback-guided Reinforcement Learning2026.01 | 90.24 | |
| InitialModel Size=7B, Sampling trajectories=82026.01 | 90.18 | |
| o1-miniAvailability=API only, Reasoning finetuning examples (# ex.)=N.A.2026.03 | 90 | |
| SafeKeyModel Size=7B, Sampling trajectories=82026.01 | 89.9 | |
| DirectRefusalModel Size=7B, Sampling trajectories=82026.01 | 89.82 | |
| DeepSeek-R1-Distill-Llama-8BArchitecture=Llama, Parameter count=8B2025.01 | 89.1 | |
| DeepSeek-R1-Distill-Llama-8BArchitecture=Dense, # Activated Params=8B, # Total Params=8B2025.12 | 89.1 | |
| Critique-GRPOBackbone=Qwen3-4B-Inst, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 88.64 | |
| Dr.GRPOBackbone=Qwen3-4B-Inst, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 88.28 | |
| GPSBackbone=DeepSeek-R1-Distill-1.5B, Strategy=GPS, Runtime=16h2026.02 | 88 | |
| GRPOBackbone=Qwen3-4B-Inst, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 87.84 | |
| Curriculum SFTModels=Qwen2.5-14B-Instruct2026.03 | 87.82 | |
| THINKSAFEModel Size=8B, Sampling trajectories=82026.01 | 87.7 | |
| SafePathModel Size=8B, Sampling trajectories=82026.01 | 87.43 | |
| InitialModel Size=8B, Sampling trajectories=82026.01 | 87.38 | |
| Rule+CERBackbone=Qwen3-8B-Base, Training Dataset=mathematical dataset2026.03 | 87.3 | |
| Dynamic Sampling (Oracle)Backbone=DeepSeek-R1-Distill-1.5B, Strategy=DS, Runtime=30h2026.02 | 87.2 | |
| DeepSeek-R1-Distill-7BBackbone=DeepSeek-R1-Distill-7B, Strategy=Base2026.02 | 87.2 | |
| CERBackbone=Qwen3-8B-Base, Reward Method=CER, Training Data Domain=General-domain2026.03 | 87.2 | |
| CERBackbone=Qwen3-8B-Base, Training Dataset=mathematical dataset2026.03 | 87.2 | |
| HEALModels=Qwen3-4B-Base2026.03 | 87.18 | |
| SFTModels=Qwen2.5-14B-Instruct2026.03 | 87.06 | |
| GEMBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=GEM2026.02 | 87 | |
| Rule-basedBackbone=Qwen3-8B-Base, Training Dataset=mathematical dataset2026.03 | 86.7 | |
| STAR-1Model Size=8B, Sampling trajectories=82026.01 | 86.65 | |
| SED-SFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT2026.02 | 86.6 | |
| SafeChainModel Size=8B, Sampling trajectories=82026.01 | 86.5 | |
| Uniform SamplingBackbone=DeepSeek-R1-Distill-1.5B, Strategy=Uniform, Runtime=16h2026.02 | 86.2 | |
| GRESOBackbone=DeepSeek-R1-Distill-1.5B, Strategy=GRESO, Runtime=27h2026.02 | 86.2 | |
| MoPPSBackbone=DeepSeek-R1-Distill-1.5B, Strategy=MoPPS, Runtime=17h2026.02 | 86.2 | |
| SCRLCandidate responses=64, Training samples=32, Backbone=Qwen2.5-Math-7B2026.03 | 86.2 | |
| SED-SFT w/o maskBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT w/o mask2026.02 | 86 | |
| Rule-basedBackbone=Qwen3-8B-Base, Reward Method=Rule-based, Training Data Domain=General-domain2026.03 | 86 | |
| VeriFreeBackbone=Qwen3-8B-Base, Reward Method=VeriFree, Training Data Domain=General-domain2026.03 | 86 | |
| General-verifierBackbone=Qwen3-8B-Base, Training Dataset=mathematical dataset2026.03 | 86 | |
| SafeKeyModel Size=8B, Sampling trajectories=82026.01 | 85.8 | |
| CrossEntropyBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=CrossEntropy2026.02 | 85.8 | |
| TTRLCandidate responses=32, Training samples=16, Backbone=Qwen2.5-Math-7B2026.03 | 85.7 | |
| Rule+CERBackbone=Qwen3-4B-Base, Reward Method=Rule+CER, Training Data Domain=General-domain2026.03 | 85.6 | |
| SCRLCandidate responses=32, Training samples=16, Backbone=Qwen2.5-Math-7B2026.03 | 85.6 | |
| o1-previewAvailability=API only, Reasoning finetuning examples (# ex.)=N.A.2026.03 | 85.5 | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=DFT2026.02 | 85.4 | |
| Rule+CERBackbone=Qwen3-8B-Base, Reward Method=Rule+CER, Training Data Domain=General-domain2026.03 | 85.2 | |
| DirectRefusalModel Size=8B, Sampling trajectories=82026.01 | 85 | |
| Rule+CERBackbone=Qwen3-4B-Base, Training Dataset=mathematical dataset2026.03 | 85 | |
| VeriFreeBackbone=Qwen3-8B-Base, Training Dataset=mathematical dataset2026.03 | 85 | |
| PCLBackbone=DeepSeek-R1-Distill-1.5B, Strategy=PCL, Runtime=17h2026.02 | 84.8 | |
| General-verifierBackbone=Qwen3-8B-Base, Reward Method=General-verifier, Training Data Domain=General-domain2026.03 | 84.8 | |
| TRAPOTraining Paradigm=Semi-supervised, Labeled Samples Count=4K, Unlabeled Samples Count=12K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 84.6 | |
| General-verifierBackbone=Qwen3-4B-Base, Reward Method=General-verifier, Training Data Domain=General-domain2026.03 | 84.6 | |
| Curriculum SFTModels=Qwen3-4B-Base2026.03 | 84.52 | |
| Rule-basedBackbone=Qwen3-4B-Base, Reward Method=Rule-based, Training Data Domain=General-domain2026.03 | 84.5 | |
| Fully SupervisedTraining Paradigm=Supervised, Labeled Samples Count=45K, Backbone Model=Qwen2.5-Math-7B, Sampling Temperature (T=0.6)=0.62025.12 | 84.4 | |
| Rule-basedBackbone=Qwen3-4B-Base, Training Dataset=mathematical dataset2026.03 | 84.2 | |
| CERBackbone=Qwen3-4B-Base, Training Dataset=mathematical dataset2026.03 | 84.1 | |
| Qwen2.5-32B-InstructAvailability=Open Weights, Reasoning finetuning examples (# ex.)=N.A.2026.03 | 84 |