Mathematical Reasoning on AIME 25 (Avg@32, Avg)
52.5Avg@32DC-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DC-GRPOBackbone=Qwen3-8B, Precision=BF162026.06 | 52.5 | 71 | |
| DC-GRPOBackbone=Qwen3-30B-A3B, Precision=BF162026.06 | 49.1 | 71.8 | |
| GRPOBackbone=Qwen3-30B-A3B, Precision=BF162026.06 | 43.6 | 69 | |
| GRPOBackbone=Qwen3-8B, Precision=BF162026.06 | 40 | 67.3 | |
| OISDBackbone=Qwen3-4B2026.05 | 36.35 | 64.75 | |
| OISDBackbone=Qwen3-8B2026.05 | 34.48 | 66.72 | |
| BuPOBackbone=Qwen3-8B2026.05 | 34.38 | 66.36 | |
| GRPOBackbone=Qwen3-8B2026.05 | 33.54 | 64.23 | |
| BuPOBackbone=Qwen3-4B2026.05 | 31.15 | 58.51 | |
| GRPOBackbone=Qwen3-4B2026.05 | 28.85 | 55.08 | |
| PPOBackbone=Qwen3-4B2026.05 | 27.6 | 55.22 | |
| RLOOBackbone=Qwen3-4B2026.05 | 24.79 | 54 | |
| VanillaBackbone=Qwen3-8B2026.05 | 19.17 | 48.49 | |
| Reinforce++Backbone=Qwen3-4B2026.05 | 18.65 | 45.03 | |
| VanillaBackbone=Qwen3-4B2026.05 | 18.6 | 47.44 | |
| OISDBackbone=OctoThinker-8B-Long-Base2026.05 | 7.5 | 30.09 | |
| BuPOBackbone=OctoThinker-8B-Long-Base2026.05 | 6.77 | 27.79 | |
| GRPOBackbone=OctoThinker-8B-Long-Base2026.05 | 2.19 | 24.11 | |
| BuPOBackbone=OctoThinker-3B-Long-Base2026.05 | 0.42 | 19.59 | |
| OISDBackbone=OctoThinker-3B-Long-Base2026.05 | 0.42 | 19.91 | |
| GRPOBackbone=OctoThinker-3B-Long-Base2026.05 | 0.1 | 18.58 | |
| VanillaBackbone=OctoThinker-8B-Long-Base2026.05 | 0.1 | 3.75 | |
| VanillaBackbone=OctoThinker-3B-Long-Base2026.05 | 0 | 1.68 |