Mathematical Reasoning on AIME 25 (Pass@1, Pass@K)
23.33Pass@1SFT (Long-CoT)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SFT (Long-CoT)Backbone=Qwen3-8B2026.01 | 23.33 | 30 | |
| UPFT (2025)Backbone=Qwen3-8B2026.01 | 23.33 | 26.67 | |
| P-ALIGNBackbone=Qwen3-8B2026.01 | 23.33 | 33.33 | |
| Zero-ShotBackbone=Qwen3-8B2026.01 | 20 | 23.33 | |
| P-ALIGNBackbone=Qwen2.5-7B-Instruct2026.01 | 16.67 | 26.67 | |
| APOBackbone=Qwen2.5-Math-7B, K=2562026.02 | 16.28 | 56.67 | |
| GRPO (Baseline)Backbone=Qwen2.5-Math-7B, K=2562026.02 | 14.99 | 56.67 | |
| NSRBackbone=Qwen2.5-Math-7B, K=2562026.02 | 14.31 | 56.67 | |
| APOBackbone=Qwen2.5-7B, K=2562026.02 | 13.5 | 50 | |
| UPFT (2025)Backbone=Qwen2.5-7B-Instruct2026.01 | 13.33 | 20 | |
| GRPO-KL (Error-Only)Backbone=Qwen2.5-Math-7B, K=2562026.02 | 12.24 | 43.33 | |
| GRPO (Baseline)Backbone=Qwen2.5-7B, K=2562026.02 | 12.2 | 50 | |
| GRPO-KLBackbone=Qwen2.5-Math-7B, K=2562026.02 | 10.68 | 46.67 | |
| SFT (Long-CoT)Backbone=Qwen2.5-7B-Instruct2026.01 | 10 | 20 | |
| SFT (Label)Backbone=Qwen3-8B2026.01 | 10 | 13.33 | |
| GRPO-KLBackbone=Qwen2.5-7B, K=2562026.02 | 7.37 | 53.33 | |
| Base ModelBackbone=Qwen2.5-Math-7B, K=2562026.02 | 7.02 | 56.67 | |
| Zero-ShotBackbone=Qwen2.5-7B-Instruct2026.01 | 6.67 | 10 | |
| Base ModelBackbone=Qwen2.5-7B, K=2562026.02 | 4.28 | 50 | |
| SFT (Label)Backbone=Qwen2.5-7B-Instruct2026.01 | 3.33 | 6.67 | |
| APOBackbone=Llama-3.2-3B-Instruct, K=2562026.02 | 0.55 | 20 | |
| GRPO-KLBackbone=Llama-3.2-3B-Instruct, K=2562026.02 | 0.33 | 20 | |
| GRPO (Baseline)Backbone=Llama-3.2-3B-Instruct, K=2562026.02 | 0.2 | 10 | |
| Base ModelBackbone=Llama-3.2-3B-Instruct, K=2562026.02 | 0.15 | 30 |