Mathematical Reasoning on AMC 2023 (Pass@k)
68.5Pass@1CaSP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CaSPBackbone=Qwen2.5-32B, alpha=0.052025.10 | 68.5 | 97.5 | — | |
| CaSPBackbone=Qwen2.5-32B, alpha=0.012025.10 | 67.5 | 97.5 | — | |
| GRPOBackbone=Qwen2.5-32B2025.10 | 65.1 | 95 | — | |
| GRPO w/ Entropy-AdvBackbone=Qwen2.5-Math-7B2025.10 | 62.5 | — | 92.1 | |
| CaSPBackbone=Qwen2.5-Math-7B2025.10 | 62.4 | — | 97.5 | |
| KL-CovBackbone=Qwen2.5-Math-7B2025.10 | 62.2 | — | 97.4 | |
| PSRBackbone=Qwen2.5-Math-7B2025.10 | 62.1 | — | 94.9 | |
| GRPO w/ Entropy lossBackbone=Qwen2.5-32B2025.10 | 62 | 95 | — | |
| GRPOBackbone=Qwen2.5-Math-7B2025.10 | 61.2 | — | 97.1 | |
| W-REINFORCEBackbone=Qwen2.5-Math-7B2025.10 | 61.1 | — | 97.4 | |
| GRPO w/ forking tokensBackbone=Qwen2.5-Math-7B2025.10 | 59.6 | — | 96.7 | |
| NSRBackbone=Qwen2.5-Math-7B2025.10 | 59.4 | — | 100 | |
| P@k T.Backbone=Qwen2.5-Math-7B2025.10 | 58.8 | — | 97.5 | |
| GRPO w/ Entropy lossBackbone=Qwen2.5-Math-7B2025.10 | 56.4 | — | 99.6 | |
| Base ModelBackbone=Qwen2.5-32B2025.10 | 42.1 | 100 | — | |
| Base ModelBackbone=Qwen2.5-Math-7B2025.10 | 38.2 | — | 98.5 | |
| CaSPBackbone=Llama3.2-3B-Instruct2025.10 | 35.2 | — | 98.8 | |
| GRPOBackbone=Llama3.2-3B-Instruct2025.10 | 32.5 | — | 96.7 | |
| W-REINFORCEBackbone=Llama3.2-3B-Instruct2025.10 | 31.4 | — | 96.3 | |
| NSRBackbone=Llama3.2-3B-Instruct2025.10 | 30.3 | — | 94.6 | |
| PSRBackbone=Llama3.2-3B-Instruct2025.10 | 27.2 | — | 98.8 | |
| Base ModelBackbone=Llama3.2-3B-Instruct2025.10 | 20.3 | — | 94.9 |