Mathematical Reasoning on Olympiad (pass@1, pass@8)
65.2Pass@1ICPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ICPOBase Model=8B, Training Method=ICPO2025.10 | 65.2 | — | |
| ICPO†Base Model=8B, Training Method=ICPO†2025.10 | 64.3 | — | |
| GRPOBase Model=8B, Training Method=GRPO2025.10 | 62.4 | — | |
| GRPOExtraRolloutsBase Model=8B, Training Method=GRPOExtraRollouts2025.10 | 61.6 | — | |
| GRPO w/ MAPRBase Model=Qwen3-14B2025.09 | 61.59 | 74.37 | |
| GRPOExpertDomainBase Model=8B, Training Method=GRPOExpertDomain2025.10 | 60 | — | |
| GRPOBase Model=Qwen3-14B2025.09 | 59.04 | 73.03 | |
| GRPO w/ MAPRBase Model=Qwen3-8B2025.09 | 56.86 | 71.87 | |
| ICPOBase Model=1.7B, Training Method=ICPO2025.10 | 56.4 | — | |
| GRPOBase Model=Qwen3-8B2025.09 | 54.03 | 70.04 | |
| GRPOExtraRolloutsBase Model=1.7B, Training Method=GRPOExtraRollouts2025.10 | 53.8 | — | |
| GRPO w/ MAPRBase Model=Qwen3-4B2025.09 | 53.38 | 69.74 | |
| ICPO†Base Model=1.7B, Training Method=ICPO†2025.10 | 52.7 | — | |
| GRPOExpertDomainBase Model=1.7B, Training Method=GRPOExpertDomain2025.10 | 50.5 | — | |
| GRPOBase Model=1.7B, Training Method=GRPO2025.10 | 48.2 | — | |
| GRPOBase Model=Qwen3-4B2025.09 | 44.47 | 61.99 | |
| Qwen3Base Model=8B, Training Method=Base2025.10 | 43.3 | — | |
| Qwen3Base Model=1.7B, Training Method=Base2025.10 | 40.6 | — | |
| MTTeacher Model=Qwen2-Math-7B-Instruct2026.04 | 37.6 | — | |
| VeriGatePolicy Model=Qwen2.5-7B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 31 | — | |
| GRPO-VanillaPolicy Model=Qwen2.5-7B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 30.67 | — | |
| PRM-as-ORMPolicy Model=Qwen2.5-7B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 30.67 | — | |
| BHA2026.04 | 26.9 | 41.2 | |
| DAPO2026.04 | 26.4 | 40.9 | |
| BREAD2026.04 | 25.5 | 40.7 | |
| VCRDTeacher Model=Qwen2-Math-7B-Instruct, Student Model=Qwen2-Math-1.5B2026.04 | 24.7 | — | |
| DistillLM-2Teacher Model=Qwen2-Math-7B-Instruct, Student Model=Qwen2-Math-1.5B2026.04 | 24.4 | — | |
| KDTeacher Model=Qwen2-Math-7B-Instruct, Student Model=Qwen2-Math-1.5B2026.04 | 23.9 | — | |
| GKDTeacher Model=Qwen2-Math-7B-Instruct, Student Model=Qwen2-Math-1.5B2026.04 | 23.7 | — | |
| DistilLLMTeacher Model=Qwen2-Math-7B-Instruct, Student Model=Qwen2-Math-1.5B2026.04 | 23.7 | — | |
| ABKDTeacher Model=Qwen2-Math-7B-Instruct, Student Model=Qwen2-Math-1.5B2026.04 | 22.4 | — | |
| Dr.GRPOPolicy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 15.5 | — | |
| PRM-as-ORM (+Gate)Policy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 15.5 | — | |
| VeriGatePolicy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 15.5 | — | |
| GRPO-VanillaPolicy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 15.29 | — | |
| Base2026.04 | 14.4 | 40.7 | |
| DAPOPolicy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 14.07 | — | |
| VeriGate (Simplified)Policy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 13.63 | — | |
| VeriGate (-Gate)Policy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 10.37 | — | |
| MSStudent Model=Qwen2-Math-1.5B2026.04 | 7.4 | — | |
| PRM-as-ORMPolicy Model=Qwen2.5-1.5B-Instruct, PRM Model=Qwen-PRM-7B2026.05 | 5.04 | — |