Mathematical Reasoning on Minerva Math (Accuracy, Average)
80.1AccuracyPass@k
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Pass@kk=16, Model=Qwen2.5-7B2026.06 | 80.1 | — | |
| Qwen3 + DAPO + Hidden-AlignSize=14B2026.06 | 64.71 | — | |
| Large greedyModel=Qwen2.5-72B2026.06 | 64.3 | — | |
| PRM-72B guided searchk=16, L=20, Base Model=Qwen2.5-7B, Guidance Model=Qwen2.5-72B2026.06 | 63.6 | — | |
| CGSk=16, L=20, Base Model=Qwen2.5-7B, Guidance Model=Qwen2.5-72B2026.06 | 63.6 | — | |
| LGSk=16, L=20, Base Model=Qwen2.5-7B, Guidance Model=Qwen2.5-72B2026.06 | 62.5 | — | |
| Qwen3 (base)Size=14B2026.06 | 61.03 | — | |
| Qwen3 + DAPOSize=14B2026.06 | 58.82 | — | |
| Borda count (large)k=16, Model=Qwen2.5-72B2026.06 | 58.5 | — | |
| Majority@kk=16, Model=Qwen2.5-7B2026.06 | 57.7 | — | |
| Qwen3 + DAPO + Hidden-AlignSize=4B2026.06 | 56.62 | — | |
| Borda count (small)k=16, Model=Qwen2.5-7B2026.06 | 56.6 | — | |
| Qwen3 (base)Size=4B2026.06 | 56.25 | — | |
| Self-Certainty (large)k=16, Model=Qwen2.5-72B2026.06 | 55.1 | — | |
| Qwen3 + DAPOSize=4B2026.06 | 53.68 | — | |
| Self-Certainty (small)k=16, Model=Qwen2.5-7B2026.06 | 53.3 | — | |
| Qwen3 + DAPO + Hidden-AlignSize=1.7B2026.06 | 52.21 | — | |
| Small greedyModel=Qwen2.5-7B2026.06 | 51.8 | — | |
| SCOPE-RLBase Model=Qwen3-4B2025.10 | 48.9 | — | |
| Best-of-Nk=16, Model=Qwen2.5-7B2026.06 | 48.9 | — | |
| CISPOBase Model=Qwen3-4B2025.10 | 47.8 | — | |
| DAPOBase Model=Qwen3-4B2025.10 | 47.1 | — | |
| GRPOBase Model=Qwen3-4B2025.10 | 46.7 | — | |
| GRPO (G=8)Objective=GRPO, G (Rollouts per prompt)=8, Steps=300, Time=15.5h2026.05 | 46.7 | — | |
| Entropy-RegBase Model=Qwen3-4B, λ=0.012025.10 | 46.3 | — | |
| KL-covBase Model=Qwen3-4B2025.10 | 46.3 | — | |
| GSPO (G=8)Objective=GSPO, G (Rollouts per prompt)=8, Steps=300, Time=14.4h2026.05 | 46.3 | — | |
| Entropy-AdvBase Model=Qwen3-4B2025.10 | 46 | — | |
| GSPO + BASISObjective=GSPO, G (Rollouts per prompt)=1, Steps=150, Time=7.2h2026.05 | 46 | — | |
| Qwen3 + DAPOSize=1.7B2026.06 | 44.85 | — | |
| GSPO + REINFORCE++Objective=GSPO, G (Rollouts per prompt)=1, Steps=300, Time=13.0h2026.05 | 44.1 | — | |
| GPG + BASISObjective=GPG, G (Rollouts per prompt)=1, Steps=150, Time=6.4h2026.05 | 43 | — | |
| GRPO + BASISObjective=GRPO, G (Rollouts per prompt)=1, Steps=150, Time=8.3h2026.05 | 42.6 | — | |
| GPG (G=8)Objective=GPG, G (Rollouts per prompt)=8, Steps=300, Time=14.0h2026.05 | 42.6 | — | |
| GPG + REINFORCE++Objective=GPG, G (Rollouts per prompt)=1, Steps=300, Time=12.9h2026.05 | 42.6 | — | |
| Qwen3-4BBase Model=Qwen3-4B2025.10 | 42.3 | — | |
| GSPO VanillaObjective=GSPO, G (Rollouts per prompt)=1, Steps=300, Time=13.0h2026.05 | 42.3 | — | |
| EEPOConfiguration=Standard2025.10 | 41.5 | 38.3 | |
| GRPOConfiguration=Standard2025.10 | 41.2 | 34.7 | |
| GRPOConfiguration=More rollouts.2025.10 | 40.8 | 35.1 | |
| GRPO + REINFORCE++Objective=GRPO, G (Rollouts per prompt)=1, Steps=300, Time=17.7h2026.05 | 40.8 | — | |
| GRPOConfiguration=Increased Ent.2025.10 | 40.4 | 35.9 | |
| GRPOConfiguration=Higher Temp.2025.10 | 40.1 | 35.2 | |
| GRPOConfiguration=DAPO Clip High.2025.10 | 40.1 | 32.7 | |
| BRIDGEBackbone=Qwen3-8B-Base2025.09 | 39.7 | 49.9 | |
| SCOPE-RLBase Model=Qwen2.5-Math-7B2025.10 | 38.2 | — | |
| Entropy-AdvBase Model=Qwen2.5-7B2025.10 | 38.2 | — | |
| KL-covBase Model=Qwen2.5-7B2025.10 | 38.2 | — | |
| SFT→RLBackbone=Qwen3-8B-Base2025.09 | 38.2 | 45.5 | |
| SCOPE-RLBase Model=Qwen2.5-7B2025.10 | 37.8 | — | |
| Entropy-AdvBase Model=Qwen2.5-Math-7B2025.10 | 37.5 | — | |
| CHORDBackbone=Qwen3-8B-Base2025.09 | 37.5 | 45.9 | |
| CISPOBase Model=Qwen2.5-Math-7B2025.10 | 37.1 | — | |
| DAPOBase Model=Qwen2.5-7B2025.10 | 37.1 | — | |
| CISPOBase Model=Qwen2.5-7B2025.10 | 37.1 | — | |
| GRPOBase Model=Qwen2.5-7B2025.10 | 36.8 | — | |
| Qwen3 (base)Size=1.7B2026.06 | 36.76 | — | |
| LUFFYBackbone=Qwen3-8B-Base2025.09 | 36.4 | 44 | |
| RLBackbone=Qwen3-8B-Base2025.09 | 36 | 42.9 | |
| Entropy-RegBase Model=Qwen2.5-Math-7B, λ=0.032025.10 | 35.7 | — | |
| KL-covBase Model=Qwen2.5-Math-7B2025.10 | 35.6 | — | |
| Entropy-RegBase Model=Qwen2.5-7B, λ=0.012025.10 | 35.5 | — | |
| Entropy-RegBase Model=Qwen2.5-Math-7B, λ=0.012025.10 | 35.3 | — | |
| GRPOBase Model=Qwen2.5-Math-7B2025.10 | 34.6 | — | |
| DAPOBase Model=Qwen2.5-Math-7B2025.10 | 34.6 | — | |
| Uni-DPOModel=Qwen2.5-Math 7B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 34.6 | — | |
| SFT+RLBackbone=Qwen3-8B-Base2025.09 | 34.2 | 40.1 | |
| ConsistencyBackbone=Deepseek-R1-Distill-Qwen-1.5B, Multiple stochastic inferences=true2026.06 | 33.8 | — | |
| EntropyBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 33.3 | — | |
| Qwen3-8B-BaseConfiguration=Base Model2025.10 | 33.1 | 29 | |
| Clip higherBase Model=Qwen2.5-Math-7B, ϵhigh=0.52025.10 | 32.7 | — | |
| SRFTBackbone=Qwen3-8B-Base2025.09 | 32.4 | 39.8 | |
| PivotTraceBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 32.4 | — | |
| CoEBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 32.3 | — | |
| SimPOModel=Qwen2.5-Math 7B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 32 | — | |
| SFTBackbone=Qwen3-8B-Base2025.09 | 32 | 37.6 | |
| RandomBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 32 | — | |
| Entropy-RegBase Model=Qwen2.5-Math-7B, λ=0.052025.10 | 31.9 | — | |
| Clip higherBase Model=Qwen2.5-Math-7B, ϵhigh=0.42025.10 | 30.1 | — | |
| CoT-KineticsBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 29.7 | — | |
| Self-CertaintyBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 29.3 | — | |
| Uni-DPOModel=Qwen2.5-Math 1.5B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 27.9 | — | |
| GRPO VanillaObjective=GRPO, G (Rollouts per prompt)=1, Steps=300, Time=20.7h2026.05 | 27.9 | — | |
| RLBackbone=Qwen2.5-3B2025.09 | 26.5 | — | |
| SimPOModel=Qwen2.5-Math 1.5B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 25.4 | — | |
| SFT→RLBackbone=Qwen2.5-3B2025.09 | 24.3 | — | |
| BaseBackbone=Qwen3-8B-Base2025.09 | 24.3 | 26.6 | |
| BRIDGEBackbone=Qwen2.5-3B2025.09 | 23.9 | — | |
| LUFFYBackbone=Qwen2.5-3B2025.09 | 23.5 | — | |
| CHORDBackbone=Qwen2.5-3B2025.09 | 23.2 | — | |
| SRFTBackbone=Qwen2.5-3B2025.09 | 22.1 | — | |
| Qwen2.5-7BBase Model=Qwen2.5-7B2025.10 | 22 | — | |
| SFT+RLBackbone=Qwen2.5-3B2025.09 | 20.6 | — | |
| DPOModel=Qwen2.5-Math 7B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 20.2 | — | |
| DPOModel=Qwen2.5-Math 1.5B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 18.8 | — | |
| SFTBackbone=Qwen2.5-3B2025.09 | 18.8 | — | |
| GPG VanillaObjective=GPG, G (Rollouts per prompt)=1, Steps=300, Time=18.6h2026.05 | 18.4 | — | |
| VRPOBase Model=LLaMA 3.1-8B-Instruct, Optimization Setting=Training-time optimization, Reward Supervision=Noisy rule-based2025.08 | 18.01 | — | |
| PPOBase Model=LLaMA 3.1-8B-Instruct, Optimization Setting=Training-time optimization, Reward Supervision=Noisy rule-based2025.08 | 17.65 | — | |
| BaseBase Model=LLaMA 3.1-8B-Instruct, Optimization Setting=Training-time optimization, Reward Supervision=Noisy rule-based2025.08 | 17.28 | — |