Mathematical Reasoning on AIME 2025 (Pass@1, Pass@128, Pass@256)
17.8Pass@1CaSP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CaSPBackbone=Qwen2.5-32B, alpha=0.012025.10 | 17.8 | 50 | — | |
| CaSPBackbone=Qwen2.5-32B, alpha=0.052025.10 | 17.8 | 53.3 | — | |
| GRPOBackbone=Qwen2.5-32B2025.10 | 16.1 | 43.3 | — | |
| GRPO w/ Entropy lossBackbone=Qwen2.5-32B2025.10 | 15.2 | 36.7 | — | |
| CaSPBackbone=Qwen2.5-Math-7B2025.10 | 12.9 | — | 64.6 | |
| KL-CovBackbone=Qwen2.5-Math-7B2025.10 | 11.7 | — | 55.2 | |
| GRPOBackbone=Qwen2.5-Math-7B2025.10 | 11.5 | — | 52.1 | |
| GRPO w/ forking tokensBackbone=Qwen2.5-Math-7B2025.10 | 11.5 | — | 57.4 | |
| PSRBackbone=Qwen2.5-Math-7B2025.10 | 11.2 | — | 48.9 | |
| GRPO w/ Entropy-AdvBackbone=Qwen2.5-Math-7B2025.10 | 10.9 | — | 55 | |
| W-REINFORCEBackbone=Qwen2.5-Math-7B2025.10 | 10.8 | — | 55.7 | |
| P@k T.Backbone=Qwen2.5-Math-7B2025.10 | 10.2 | — | 61.3 | |
| NSRBackbone=Qwen2.5-Math-7B2025.10 | 9.7 | — | 61.2 | |
| GRPO w/ Entropy lossBackbone=Qwen2.5-Math-7B2025.10 | 9.1 | — | 55.1 | |
| Base ModelBackbone=Qwen2.5-Math-7B2025.10 | 5.4 | — | 51.8 | |
| Base ModelBackbone=Qwen2.5-32B2025.10 | 4.9 | 50 | — | |
| NSRBackbone=Llama3.2-3B-Instruct2025.10 | 1.5 | — | 47.4 | |
| GRPOBackbone=Llama3.2-3B-Instruct2025.10 | 1.1 | — | 44.1 | |
| W-REINFORCEBackbone=Llama3.2-3B-Instruct2025.10 | 1.1 | — | 42.1 | |
| PSRBackbone=Llama3.2-3B-Instruct2025.10 | 1 | — | 35.1 | |
| CaSPBackbone=Llama3.2-3B-Instruct2025.10 | 1 | — | 45.4 | |
| Base ModelBackbone=Llama3.2-3B-Instruct2025.10 | 0.7 | — | 46.7 |