Mathematical Reasoning on AIME24 (Avg@32, Avg)
54.06AIME24 Avg@32 ScoreBuPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BuPOBackbone=Qwen3-8B2026.05 | 54.06 | 66.36 | |
| OISDBackbone=Qwen3-8B2026.05 | 52.4 | 66.72 | |
| GRPOBackbone=Qwen3-8B2026.05 | 49.48 | 64.23 | |
| OISDBackbone=Qwen3-4B2026.05 | 47.29 | 64.75 | |
| BuPOBackbone=Qwen3-4B2026.05 | 36.88 | 58.51 | |
| PPOBackbone=Qwen3-4B2026.05 | 32.6 | 55.22 | |
| GRPOBackbone=Qwen3-4B2026.05 | 32.19 | 55.08 | |
| RLOOBackbone=Qwen3-4B2026.05 | 30.83 | 54 | |
| VanillaBackbone=Qwen3-8B2026.05 | 26.98 | 48.49 | |
| VanillaBackbone=Qwen3-4B2026.05 | 23.2 | 47.44 | |
| Reinforce++Backbone=Qwen3-4B2026.05 | 17.4 | 45.03 | |
| OISDBackbone=OctoThinker-8B-Long-Base2026.05 | 7.29 | 30.09 | |
| BuPOBackbone=OctoThinker-8B-Long-Base2026.05 | 4.69 | 27.79 | |
| GRPOBackbone=OctoThinker-8B-Long-Base2026.05 | 2.5 | 24.11 | |
| OISDBackbone=OctoThinker-3B-Long-Base2026.05 | 1.98 | 19.91 | |
| GRPOBackbone=OctoThinker-3B-Long-Base2026.05 | 0.63 | 18.58 | |
| BuPOBackbone=OctoThinker-3B-Long-Base2026.05 | 0.63 | 19.59 | |
| VanillaBackbone=OctoThinker-8B-Long-Base2026.05 | 0.52 | 3.75 | |
| VanillaBackbone=OctoThinker-3B-Long-Base2026.05 | 0.21 | 1.68 |