Mathematical Reasoning on Aggregate AIME-2024 AIME-2025 MATH500 OlympiadBench AMC23
52.57AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBackbone=Qwen3-8B-Base2026.05 | 52.57 | 63.47 | |
| DVAOBackbone=Qwen3-8B-Base2026.05 | 47.49 | 99.92 | |
| Reward Combination (RC)Backbone=Qwen3-8B-Base2026.05 | 46.26 | 98.71 | |
| Advantage Combination (AC)Backbone=Qwen3-8B-Base2026.05 | 45.42 | 98.84 | |
| DVAOBackbone=Qwen3-4B-Base2026.05 | 42.19 | 99.91 | |
| GRPOBackbone=Qwen3-4B-Base2026.05 | 39.91 | 77.84 | |
| Reward Combination (RC)Backbone=Qwen3-4B-Base2026.05 | 38.99 | 96.39 | |
| Advantage Combination (AC)Backbone=Qwen3-4B-Base2026.05 | 38.75 | 96.23 | |
| Qwen3 Base ModelBackbone=Qwen3-8B-Base2026.05 | 33.31 | 94.28 | |
| Qwen3 Base ModelBackbone=Qwen3-4B-Base2026.05 | 25.78 | 90.41 | |
| GDPOBackbone=Qwen3-8B-Base2026.05 | 14.69 | 99.99 | |
| GDPOBackbone=Qwen3-4B-Base2026.05 | 13.41 | 97.81 |