Mathematical Reasoning on AMC (Pass@1 accuracy)
83.75Pass@1 AccuracySFPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SFPOModel=DS-distilled-Qwen-7B2025.10 | 83.75 | |
| GRPOModel=DS-distilled-Qwen-7B2025.10 | 80.42 | |
| SFPOModel=Qwen2.5-Math-7B2025.10 | 74.49 | |
| GRPOModel=Qwen2.5-Math-7B2025.10 | 71.08 | |
| SFPOModel=DS-distilled-Qwen-1.5B2025.10 | 70.28 | |
| SCRLCandidate responses=64, Training samples=32, Backbone=Qwen2.5-Math-7B2026.03 | 68.5 | |
| TTRLCandidate responses=64, Training samples=32, Backbone=Qwen2.5-Math-7B2026.03 | 68.1 | |
| SCRLCandidate responses=32, Training samples=16, Backbone=Qwen2.5-Math-7B2026.03 | 66.9 | |
| GRPOModel=DS-distilled-Qwen-1.5B2025.10 | 66.86 | |
| TTRLCandidate responses=32, Training samples=16, Backbone=Qwen2.5-Math-7B2026.03 | 65.7 | |
| BaseModel=DS-distilled-Qwen-7B2025.10 | 61.75 | |
| PrismBase model=Qwen3-4B-Base2026.03 | 61.25 | |
| GRPOModel=Qwen3-4B-Base2025.10 | 59.03 | |
| SPICEBase model=Qwen3-4B-Base2026.03 | 57.5 | |
| R-ZeroBase model=Qwen3-4B-Base2026.03 | 57.27 | |
| SFPOModel=Qwen3-4B-Base2025.10 | 57.23 | |
| SRGenModel=Qwen3-32B2025.10 | 56.8 | |
| SFPOModel=Qwen2.5-Math-1.5B2025.10 | 56.02 | |
| Self-RefineModel=Qwen3-32B2025.10 | 54.4 | |
| CoTModel=Qwen3-32B2025.10 | 54 | |
| BaseModel=Qwen2.5-Math-7B2025.10 | 53.61 | |
| GRPOModel=Qwen2.5-Math-1.5B2025.10 | 53.31 | |
| R-FewBase model=Qwen3-4B-Base, Selection percentage=1%2026.03 | 52.7 | |
| Absolute ZeroBase model=Qwen3-4B-Base2026.03 | 52.5 | |
| R-FewBase model=Qwen3-4B-Base, Selection percentage=5%2026.03 | 52.4 | |
| DCRLBackbone=Qwen3-8B-Base2026.03 | 51.9 | |
| Self-RefineModel=DS-R1-Qwen-7B2025.10 | 51.6 | |
| SRGenModel=DS-R1-Qwen-7B2025.10 | 51.2 | |
| CoTModel=DS-R1-Qwen-7B2025.10 | 51 | |
| SRGenModel=DS-R1-Llama-8B2025.10 | 50.6 | |
| CoTModel=DS-R1-Llama-8B2025.10 | 50 | |
| Self-RefineModel=DS-R1-Llama-8B2025.10 | 49.4 | |
| BaseModel=DS-distilled-Qwen-1.5B2025.10 | 47.59 | |
| Qwen3-4B-Base2026.03 | 47.5 | |
| VeriGatePolicy Model=Qwen2.5-7B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 45.78 | |
| DCRLBackbone=Qwen3-4B-Base2026.03 | 45.6 | |
| KTOBackbone=Qwen2.5-Math-7B2025.09 | 43.1 | |
| FPABackbone=Qwen3-4B-Base2025.09 | 42.8 | |
| FPABackbone=Qwen2.5-Math-7B2025.09 | 42.3 | |
| GRPO-VanillaPolicy Model=Qwen2.5-7B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 42.17 | |
| Off-RLBackbone=Qwen2.5-Math-7B2025.09 | 42 | |
| SCRLCandidate responses=32, Training samples=16, Backbone=Qwen2.5-3B2026.03 | 41.5 | |
| SCRLCandidate responses=64, Training samples=32, Backbone=Qwen2.5-3B2026.03 | 41.3 | |
| SRGenModel=Qwen2.5-Math-7B2025.10 | 41.2 | |
| PRM-as-ORMPolicy Model=Qwen2.5-7B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 40.96 | |
| SFTBackbone=Qwen2.5-Math-7B2025.09 | 40.8 | |
| RPOBackbone=Qwen2.5-Math-7B2025.09 | 40.7 | |
| DPOBackbone=Qwen2.5-Math-7B2025.09 | 40 | |
| TTRLCandidate responses=64, Training samples=32, Backbone=Qwen2.5-3B2026.03 | 39.5 | |
| TTRLCandidate responses=32, Training samples=16, Backbone=Qwen2.5-3B2026.03 | 39.4 | |
| DPOBackbone=Qwen3-4B-Base2025.09 | 39.4 | |
| A*-POBackbone=Qwen2.5-Math-7B2025.09 | 38.9 | |
| BaseModel=Qwen2.5-Math-1.5B2025.10 | 37.65 | |
| Off-RLBackbone=Qwen3-4B-Base2025.09 | 36.9 | |
| BaseBackbone=Qwen2.5-Math-7B2025.09 | 36.8 | |
| KTOBackbone=Qwen3-4B-Base2025.09 | 35.4 | |
| Qwen2.5-Math-7BCandidate responses=32, Training samples=16, Backbone=Qwen2.5-Math-7B2026.03 | 34 | |
| Qwen2.5-Math-7BCandidate responses=64, Training samples=32, Backbone=Qwen2.5-Math-7B2026.03 | 34 | |
| CoTModel=Qwen2.5-Math-7B2025.10 | 34 | |
| RPOBackbone=Qwen3-4B-Base2025.09 | 33.5 | |
| A*-POBackbone=Qwen3-4B-Base2025.09 | 33.3 | |
| Self-RefineModel=Qwen2.5-Math-7B2025.10 | 32.4 | |
| SFTBackbone=Qwen3-4B-Base2025.09 | 31.2 | |
| BaseBackbone=Qwen3-4B-Base2025.09 | 29.8 | |
| VeriGatePolicy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 27.71 | |
| PRM-as-ORM (+Gate)Policy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 25.3 | |
| DCRLBackbone=Llama3.2-3B-Instruct2026.03 | 23.3 | |
| Qwen2.5-3BCandidate responses=32, Training samples=16, Backbone=Qwen2.5-3B2026.03 | 23.2 | |
| Qwen2.5-3BCandidate responses=64, Training samples=32, Backbone=Qwen2.5-3B2026.03 | 23.2 | |
| VeriGate (Simplified)Policy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 21.69 | |
| BaseModel=Qwen3-4B-Base2025.10 | 20.48 | |
| FPABackbone=Llama-3.2-3B-Instruct2025.09 | 18.4 | |
| BaseBackbone=Llama-3.2-3B-Instruct2025.09 | 16.3 | |
| SFTBackbone=Llama-3.2-3B-Instruct2025.09 | 16.2 | |
| Dr.GRPOPolicy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 15.66 | |
| DPOBackbone=Llama-3.2-3B-Instruct2025.09 | 15.6 | |
| GRPO-VanillaPolicy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 15.1 | |
| RPOBackbone=Llama-3.2-3B-Instruct2025.09 | 14.9 | |
| KTOBackbone=Llama-3.2-3B-Instruct2025.09 | 14.8 | |
| Off-RLBackbone=Llama-3.2-3B-Instruct2025.09 | 14.1 | |
| DAPOPolicy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 14.1 | |
| A*-POBackbone=Llama-3.2-3B-Instruct2025.09 | 13.4 | |
| VeriGate (-Gate)Policy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 7.23 | |
| PRM-as-ORMPolicy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 3.61 |