Mathematical Reasoning on Combined Mathematical Reasoning Benchmarks
75.81Average AccuracySRaR
Evaluation Results
| Method | Links | |
|---|---|---|
| SRaRModel Size=32B2026.05 | 75.81 | |
| RaRModel Size=32B2026.05 | 73.06 | |
| SRaRModel Size=8B2026.05 | 72.53 | |
| DAPOModel Size=32B2026.05 | 72.31 | |
| RaRModel Size=8B2026.05 | 68.96 | |
| RGR-GRPOModel Size=32B2026.05 | 67.73 | |
| DAPOModel Size=8B2026.05 | 67.26 | |
| RGR-GRPOModel Size=8B2026.05 | 63.24 | |
| GRPO-VPSModel Size=8B2026.05 | 61.68 | |
| GRPOModel Size=32B2026.05 | 61.65 | |
| GRPO-VPSModel Size=32B2026.05 | 61.4 | |
| GRPOModel Size=8B2026.05 | 58.54 | |
| BaselineModel Size=32B2026.05 | 54.63 | |
| BaselineModel Size=8B2026.05 | 53.4 | |
| OPEFOBackbone=Qwen2.5-Math-7B2026.05 | 52.4 | |
| OPEFOBackbone=Qwen3-Base-4B2026.05 | 51.9 | |
| Clip–CovBackbone=Qwen2.5-Math-7B2026.05 | 50.7 | |
| KL–CovBackbone=Qwen2.5-Math-7B2026.05 | 50.5 | |
| GRPO (Strict on-policy)Backbone=Qwen2.5-Math-7B2026.05 | 50.1 | |
| GRPO (Strict on-policy)Backbone=Qwen3-Base-4B2026.05 | 50.1 | |
| Clip-higherBackbone=Qwen2.5-Math-7B2026.05 | 49.8 | |
| KL–CovBackbone=Qwen3-Base-4B2026.05 | 49.2 | |
| Clip-higherBackbone=Qwen3-Base-4B2026.05 | 49.1 | |
| Clip–CovBackbone=Qwen3-Base-4B2026.05 | 48.9 | |
| Entropy-RegBackbone=Qwen3-Base-4B2026.05 | 48 | |
| Entropy-RegBackbone=Qwen2.5-Math-7B2026.05 | 47.8 | |
| GRPOBackbone=Qwen2.5-Math-7B2026.05 | 45.5 | |
| GRPOBackbone=Qwen3-Base-4B2026.05 | 44.8 | |
| Qwen3-Base-4BBackbone=Qwen3-Base-4B2026.05 | 36.4 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B2026.05 | 21.2 |