Mathematical Reasoning on Minerva Math (Pass@1, Pass@128, Pass@256)
45.2Pass@1CaSP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CaSPBackbone=Qwen2.5-32B, alpha=0.052025.10 | 45.2 | 67.3 | — | |
| CaSPBackbone=Qwen2.5-32B, alpha=0.012025.10 | 43.9 | 65.8 | — | |
| GRPOBackbone=Qwen2.5-32B2025.10 | 43.1 | 61.4 | — | |
| GRPO w/ Entropy lossBackbone=Qwen2.5-32B2025.10 | 42.7 | 60.3 | — | |
| CaSPBackbone=Qwen2.5-Math-7B2025.10 | 35 | — | 68.4 | |
| GRPO w/ Entropy lossBackbone=Qwen2.5-Math-7B2025.10 | 34.9 | — | 68 | |
| KL-CovBackbone=Qwen2.5-Math-7B2025.10 | 34.4 | — | 66.2 | |
| GRPO w/ forking tokensBackbone=Qwen2.5-Math-7B2025.10 | 33.9 | — | 65.1 | |
| GRPO w/ Entropy-AdvBackbone=Qwen2.5-Math-7B2025.10 | 33.5 | — | 60.7 | |
| GRPOBackbone=Qwen2.5-Math-7B2025.10 | 33.4 | — | 64 | |
| W-REINFORCEBackbone=Qwen2.5-Math-7B2025.10 | 33.4 | — | 67.6 | |
| P@k T.Backbone=Qwen2.5-Math-7B2025.10 | 33.2 | — | 68.8 | |
| NSRBackbone=Qwen2.5-Math-7B2025.10 | 32.9 | — | 65.1 | |
| PSRBackbone=Qwen2.5-Math-7B2025.10 | 32.8 | — | 63.6 | |
| Base ModelBackbone=Qwen2.5-32B2025.10 | 27 | 67.6 | — | |
| NSRBackbone=Llama3.2-3B-Instruct2025.10 | 19 | — | 60.3 | |
| PSRBackbone=Llama3.2-3B-Instruct2025.10 | 18.5 | — | 61 | |
| CaSPBackbone=Llama3.2-3B-Instruct2025.10 | 18.5 | — | 63.2 | |
| GRPOBackbone=Llama3.2-3B-Instruct2025.10 | 17.3 | — | 62.5 | |
| W-REINFORCEBackbone=Llama3.2-3B-Instruct2025.10 | 16.7 | — | 59.9 | |
| Base ModelBackbone=Qwen2.5-Math-7B2025.10 | 16.5 | — | 68.8 | |
| Base ModelBackbone=Llama3.2-3B-Instruct2025.10 | 10.1 | — | 59.2 |