Mathematical Reasoning on AIME 2024 (Pass@1, Pass@128, Pass@256)
32.8Pass@1CaSP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CaSPBackbone=Qwen2.5-Math-7B2025.10 | 32.8 | — | 78 | |
| CaSPBackbone=Qwen2.5-32B, alpha=0.052025.10 | 31.8 | 70 | — | |
| KL-CovBackbone=Qwen2.5-Math-7B2025.10 | 30.9 | — | 81.2 | |
| CaSPBackbone=Qwen2.5-32B, alpha=0.012025.10 | 29.9 | 73.3 | — | |
| W-REINFORCEBackbone=Qwen2.5-Math-7B2025.10 | 29.2 | — | 86.5 | |
| GRPO w/ Entropy-AdvBackbone=Qwen2.5-Math-7B2025.10 | 29.1 | — | 81.7 | |
| GRPO w/ forking tokensBackbone=Qwen2.5-Math-7B2025.10 | 28.6 | — | 74.6 | |
| GRPOBackbone=Qwen2.5-Math-7B2025.10 | 28.1 | — | 72.3 | |
| GRPOBackbone=Qwen2.5-32B2025.10 | 27.3 | 66.7 | — | |
| P@k T.Backbone=Qwen2.5-Math-7B2025.10 | 26.7 | — | 77.9 | |
| GRPO w/ Entropy lossBackbone=Qwen2.5-Math-7B2025.10 | 26.3 | — | 72.2 | |
| GRPO w/ Entropy lossBackbone=Qwen2.5-32B2025.10 | 25.3 | 66.7 | — | |
| NSRBackbone=Qwen2.5-Math-7B2025.10 | 22.8 | — | 80.3 | |
| PSRBackbone=Qwen2.5-Math-7B2025.10 | 19.3 | — | 68.5 | |
| CaSPBackbone=Llama3.2-3B-Instruct2025.10 | 13.8 | — | 54.6 | |
| W-REINFORCEBackbone=Llama3.2-3B-Instruct2025.10 | 13.3 | — | 51.7 | |
| Base ModelBackbone=Qwen2.5-Math-7B2025.10 | 13.2 | — | 66 | |
| GRPOBackbone=Llama3.2-3B-Instruct2025.10 | 12.7 | — | 55.1 | |
| NSRBackbone=Llama3.2-3B-Instruct2025.10 | 11.1 | — | 53.7 | |
| Base ModelBackbone=Qwen2.5-32B2025.10 | 9.7 | 63.3 | — | |
| PSRBackbone=Llama3.2-3B-Instruct2025.10 | 7.8 | — | 57.4 | |
| Base ModelBackbone=Llama3.2-3B-Instruct2025.10 | 3.4 | — | 51.7 |