Mathematical Reasoning on AIME 2025 (Accuracy, Length Compliance)
24.58AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBackbone=Qwen3-8B-Base2026.05 | 24.58 | 52.08 | |
| DVAOBackbone=Qwen3-8B-Base2026.05 | 18.33 | 100 | |
| Reward Combination (RC)Backbone=Qwen3-8B-Base2026.05 | 16.25 | 99.38 | |
| Advantage Combination (AC)Backbone=Qwen3-8B-Base2026.05 | 15.62 | 98.96 | |
| DVAOBackbone=Qwen3-4B-Base2026.05 | 13.54 | 99.79 | |
| GRPOBackbone=Qwen3-4B-Base2026.05 | 10.2 | 68.33 | |
| Reward Combination (RC)Backbone=Qwen3-4B-Base2026.05 | 9.38 | 95.42 | |
| Advantage Combination (AC)Backbone=Qwen3-4B-Base2026.05 | 9.38 | 95.21 | |
| Qwen3 Base ModelBackbone=Qwen3-8B-Base2026.05 | 8.96 | 93.33 | |
| Qwen3 Base ModelBackbone=Qwen3-4B-Base2026.05 | 4.79 | 88.54 | |
| GDPOBackbone=Qwen3-4B-Base2026.05 | 3.75 | 96.46 | |
| GDPOBackbone=Qwen3-8B-Base2026.05 | 0 | 100 |