Mathematical Reasoning on MATH-500 (Pass@1 and Pass@K)
82.65Pass@1APO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| APOBackbone=Qwen2.5-Math-7B, K=162026.02 | 82.65 | 94 | |
| NSRBackbone=Qwen2.5-Math-7B, K=162026.02 | 81.48 | 93.4 | |
| GRPO (Baseline)Backbone=Qwen2.5-Math-7B, K=162026.02 | 81.25 | 93.2 | |
| s1.1-7BBackbone=Qwen2.5-7B, Pure SFT?=false2025.12 | 80.8 | — | |
| APOBackbone=Qwen2.5-7B, K=162026.02 | 79.6 | 90 | |
| GRPO-KL (Error-Only)Backbone=Qwen2.5-Math-7B, K=162026.02 | 79.51 | 92.4 | |
| GRPO (Baseline)Backbone=Qwen2.5-7B, K=162026.02 | 78.53 | 91.4 | |
| GRPO-KLBackbone=Qwen2.5-Math-7B, K=162026.02 | 77.68 | 91.4 | |
| Qwen InstructBackbone=Qwen2.5-7B, Pure SFT?=false2025.12 | 75.2 | — | |
| Qwen InstructBackbone=Qwen2.5-Math-1.5B, Pure SFT?=false2025.12 | 74.8 | — | |
| GRPO-KLBackbone=Qwen2.5-7B, K=162026.02 | 73.83 | 90 | |
| QLoRABackbone=Qwen2.5-7B, Pure SFT?=true2025.12 | 70.4 | — | |
| QLoRABackbone=Qwen2.5-Math-1.5B, Pure SFT?=true2025.12 | 70.4 | — | |
| LadderBackbone=Qwen2.5-7B, Pure SFT?=true2025.12 | 68.9 | — | |
| LadderBackbone=Qwen2.5-Math-1.5B, Pure SFT?=true2025.12 | 67.2 | — | |
| Qwen BaseBackbone=Qwen2.5-7B, Pure SFT?=true2025.12 | 61.2 | — | |
| Full SFTBackbone=Qwen2.5-7B, Pure SFT?=false2025.12 | 58.6 | — | |
| Base ModelBackbone=Qwen2.5-Math-7B, K=162026.02 | 57.7 | 89.6 | |
| Base ModelBackbone=Qwen2.5-7B, K=162026.02 | 53.65 | 89.6 | |
| APOBackbone=Llama-3.2-3B-Instruct, K=162026.02 | 49.43 | 70.2 | |
| Full SFTBackbone=Qwen2.5-Math-1.5B, Pure SFT?=true2025.12 | 49 | — | |
| GRPO (Baseline)Backbone=Llama-3.2-3B-Instruct, K=162026.02 | 47.91 | 68 | |
| GRPO-KLBackbone=Llama-3.2-3B-Instruct, K=162026.02 | 44.71 | 68.6 | |
| Base ModelBackbone=Llama-3.2-3B-Instruct, K=162026.02 | 44.57 | 75.6 | |
| Qwen BaseBackbone=Qwen2.5-Math-1.5B, Pure SFT?=true2025.12 | 42 | — |