Mathematical Reasoning on AMC 23
87.5Pass@1MinPRO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MinPROModel Scale=14B-Base, Off-policyness=Large, Generations per prompt=1282026.01 | 87.5 | — | |
| CISPOModel Scale=14B-Base, Off-policyness=Large, Generations per prompt=1282026.01 | 85.7 | — | |
| M2POModel Scale=14B-Base, Off-policyness=Large, Generations per prompt=1282026.01 | 85.7 | — | |
| MinPROModel Scale=8B-Base, Off-policyness=Large, Generations per prompt=1282026.01 | 82.5 | — | |
| M2POModel Scale=8B-Base, Off-policyness=Large, Generations per prompt=1282026.01 | 82.2 | — | |
| GSPOModel Scale=14B-Base, Off-policyness=Large, Generations per prompt=1282026.01 | 80.8 | — | |
| CISPOModel Scale=8B-Base, Off-policyness=Large, Generations per prompt=1282026.01 | 78.9 | — | |
| APOBackbone=Qwen2.5-Math-7B, K=2562026.02 | 75.51 | 100 | |
| GRPO-KL (Error-Only)Backbone=Qwen2.5-Math-7B, K=2562026.02 | 75.24 | 100 | |
| NSRBackbone=Qwen2.5-Math-7B, K=2562026.02 | 70.1 | 97.5 | |
| APOBackbone=Qwen2.5-7B, K=2562026.02 | 69.75 | 100 | |
| GRPO (Baseline)Backbone=Qwen2.5-Math-7B, K=2562026.02 | 69.5 | 97.5 | |
| GRPO-KLBackbone=Qwen2.5-Math-7B, K=2562026.02 | 68.04 | 100 | |
| GRPO (Baseline)Backbone=Qwen2.5-7B, K=2562026.02 | 67.71 | 97.5 | |
| GRPOModel Scale=14B-Base, Off-policyness=Large, Generations per prompt=1282026.01 | 67 | — | |
| GRPO w/ OAR-PBackbone=Qwen2.5-Math-7B2026.01 | 65.6 | 92.8 | |
| GRPO w/ Entropy AdvBackbone=Qwen2.5-Math-7B2026.01 | 65.4 | 90.6 | |
| GRPO w/ OAR-GBackbone=Qwen2.5-Math-7B2026.01 | 65.2 | 92.5 | |
| GRPO w/ KTAEBackbone=Qwen2.5-Math-7B2026.01 | 65.1 | 89.7 | |
| GRPOBackbone=Qwen2.5-Math-7B2026.01 | 64.5 | 90.6 | |
| GSPOModel Scale=8B-Base, Off-policyness=Large, Generations per prompt=1282026.01 | 64.4 | — | |
| GRPO w/ Random AdvBackbone=Qwen2.5-Math-7B2026.01 | 64 | 90.2 | |
| GRPOModel Scale=8B-Base, Off-policyness=Large, Generations per prompt=1282026.01 | 63.3 | — | |
| GRPO w/ Entropy AdvBackbone=Qwen2.5-7B2026.01 | 62.2 | 86.4 | |
| GRPO w/ OAR-PBackbone=Qwen2.5-7B2026.01 | 61.9 | 87.7 | |
| GRPO w/ OAR-GBackbone=Qwen2.5-7B2026.01 | 61.4 | 86.9 | |
| GRPO-KLBackbone=Qwen2.5-7B, K=2562026.02 | 61.26 | 100 | |
| GRPO w/ Random AdvBackbone=Qwen2.5-7B2026.01 | 60.1 | 85.5 | |
| GRPOBackbone=Qwen2.5-7B2026.01 | 59.8 | 85 | |
| SetPO+DAPOBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 53.2 | — | |
| SetPO+GRPOBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 51.3 | — | |
| SetPO+GSPOBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 50.6 | — | |
| DAPOBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 50.1 | — | |
| GSPOBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 48.8 | — | |
| GRPOBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 47.5 | — | |
| APOBackbone=Llama-3.2-3B-Instruct, K=2562026.02 | 46.52 | 75 | |
| GRPO (Baseline)Backbone=Llama-3.2-3B-Instruct, K=2562026.02 | 46 | 72.5 | |
| Base ModelBackbone=Qwen2.5-Math-7B, K=2562026.02 | 45.62 | 100 | |
| GRPO-KLBackbone=Llama-3.2-3B-Instruct, K=2562026.02 | 37.08 | 75 | |
| Base ModelBackbone=Qwen2.5-7B, K=2562026.02 | 34.24 | 100 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B2026.01 | 33.2 | 88.3 | |
| Qwen2.5-Math-1.5BBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 29.5 | — | |
| Qwen2.5-7BBackbone=Qwen2.5-7B2026.01 | 29.5 | 81.4 | |
| Base ModelBackbone=Llama-3.2-3B-Instruct, K=2562026.02 | 24.38 | 85 | |
| BaseModel Scale=14B-Base, Off-policyness=Large, Generations per prompt=1282026.01 | 22.9 | — | |
| BaseModel Scale=8B-Base, Off-policyness=Large, Generations per prompt=1282026.01 | 21.6 | — |