Mathematical Reasoning on AIME 24 (Avg@32)
27.92Avg@32GSPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GSPOBackbone=Qwen3-8B-Base2026.02 | 27.92 | |
| GRPO + CBS*Backbone=Qwen3-8B-Base2026.02 | 26.46 | |
| GSPO + CBS*Backbone=Qwen3-8B-Base2026.02 | 25.1 | |
| DAPO + CBS*Backbone=Qwen3-8B-Base2026.02 | 24.38 | |
| GRPO + CBSBackbone=Qwen3-8B-Base2026.02 | 23.65 | |
| DAPO + CBSBackbone=Qwen3-8B-Base2026.02 | 23.54 | |
| GSPO + CBSBackbone=Qwen3-8B-Base2026.02 | 23.02 | |
| DAPOBackbone=Qwen3-8B-Base2026.02 | 22.29 | |
| GSPO + CBSBackbone=Qwen3-4B-Base2026.02 | 21.46 | |
| GSPO + CBS*Backbone=Qwen3-4B-Base2026.02 | 21.25 | |
| GRPOBackbone=Qwen3-4B-Base2026.02 | 21.04 | |
| DAPO + CBSBackbone=Qwen3-4B-Base2026.02 | 20.62 | |
| GRPO + CBS*Backbone=Qwen3-4B-Base2026.02 | 20.52 | |
| GRPOBackbone=Qwen3-8B-Base2026.02 | 20.52 | |
| GRPO + CBSBackbone=Qwen3-4B-Base2026.02 | 20.31 | |
| DAPO + CBS*Backbone=Qwen3-4B-Base2026.02 | 18.96 | |
| GSPOBackbone=Qwen3-4B-Base2026.02 | 18.44 | |
| DAPOBackbone=Qwen3-4B-Base2026.02 | 16.88 | |
| GSPO + CBS*Backbone=Qwen3-1.7B-Base2026.02 | 12.5 | |
| GRPO + CBS*Backbone=Qwen3-1.7B-Base2026.02 | 11.98 | |
| GSPO + CBSBackbone=Qwen3-1.7B-Base2026.02 | 11.35 | |
| GSPOBackbone=Qwen3-1.7B-Base2026.02 | 10.73 | |
| DAPO + CBS*Backbone=Qwen3-1.7B-Base2026.02 | 10.52 | |
| GRPOBackbone=Qwen3-1.7B-Base2026.02 | 9.58 | |
| DAPO + CBSBackbone=Qwen3-1.7B-Base2026.02 | 8.96 | |
| Base ModelBackbone=Qwen3-8B-Base2026.02 | 8.33 | |
| GRPO + CBSBackbone=Qwen3-1.7B-Base2026.02 | 8.12 | |
| DAPOBackbone=Qwen3-1.7B-Base2026.02 | 6.35 | |
| Base ModelBackbone=Qwen3-4B-Base2026.02 | 5.1 | |
| Base ModelBackbone=Qwen3-1.7B-Base2026.02 | 1.77 |