Mathematical Reasoning on MATH 500 (Pass@1, Pass@128, Pass@256)
83.8Pass@1CaSP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CaSPBackbone=Qwen2.5-32B, alpha=0.052025.10 | 83.8 | 96.8 | — | |
| CaSPBackbone=Qwen2.5-32B, alpha=0.012025.10 | 83.3 | 97 | — | |
| GRPOBackbone=Qwen2.5-32B2025.10 | 82.7 | 93.8 | — | |
| GRPO w/ Entropy lossBackbone=Qwen2.5-32B2025.10 | 82.7 | 95.2 | — | |
| CaSPBackbone=Qwen2.5-Math-7B2025.10 | 77.6 | — | 96.8 | |
| GRPO w/ forking tokensBackbone=Qwen2.5-Math-7B2025.10 | 77.4 | — | 94.4 | |
| GRPO w/ Entropy-AdvBackbone=Qwen2.5-Math-7B2025.10 | 77.1 | — | 95 | |
| GRPOBackbone=Qwen2.5-Math-7B2025.10 | 76.6 | — | 96.2 | |
| KL-CovBackbone=Qwen2.5-Math-7B2025.10 | 76.5 | — | 97 | |
| W-REINFORCEBackbone=Qwen2.5-Math-7B2025.10 | 76.4 | — | 96.4 | |
| GRPO w/ Entropy lossBackbone=Qwen2.5-Math-7B2025.10 | 75.1 | — | 97 | |
| NSRBackbone=Qwen2.5-Math-7B2025.10 | 74.6 | — | 97 | |
| PSRBackbone=Qwen2.5-Math-7B2025.10 | 74 | — | 91.4 | |
| P@k T.Backbone=Qwen2.5-Math-7B2025.10 | 73.3 | — | 96.8 | |
| Base ModelBackbone=Qwen2.5-32B2025.10 | 64.5 | 97 | — | |
| Base ModelBackbone=Qwen2.5-Math-7B2025.10 | 55.8 | — | 96 | |
| CaSPBackbone=Llama3.2-3B-Instruct2025.10 | 54.6 | — | 93.4 | |
| NSRBackbone=Llama3.2-3B-Instruct2025.10 | 53.3 | — | 94 | |
| GRPOBackbone=Llama3.2-3B-Instruct2025.10 | 53.1 | — | 91.6 | |
| W-REINFORCEBackbone=Llama3.2-3B-Instruct2025.10 | 52.4 | — | 92.8 | |
| PSRBackbone=Llama3.2-3B-Instruct2025.10 | 50.3 | — | 91 | |
| Base ModelBackbone=Llama3.2-3B-Instruct2025.10 | 37.8 | — | 93.6 |