Mathematical Reasoning on AIME 2024 (Accuracy, Length Compliance)
29.58AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBackbone=Qwen3-8B-Base2026.05 | 29.58 | 40 | |
| DVAOBackbone=Qwen3-8B-Base2026.05 | 21.87 | 100 | |
| Reward Combination (RC)Backbone=Qwen3-8B-Base2026.05 | 21.04 | 97.08 | |
| Advantage Combination (AC)Backbone=Qwen3-8B-Base2026.05 | 20.41 | 97.71 | |
| GRPOBackbone=Qwen3-4B-Base2026.05 | 17.91 | 62.08 | |
| DVAOBackbone=Qwen3-4B-Base2026.05 | 16.87 | 100 | |
| Advantage Combination (AC)Backbone=Qwen3-4B-Base2026.05 | 16.25 | 91.04 | |
| Reward Combination (RC)Backbone=Qwen3-4B-Base2026.05 | 14.58 | 92.5 | |
| Qwen3 Base ModelBackbone=Qwen3-8B-Base2026.05 | 11.87 | 89.79 | |
| Qwen3 Base ModelBackbone=Qwen3-4B-Base2026.05 | 7.92 | 88.12 | |
| GDPOBackbone=Qwen3-4B-Base2026.05 | 2.08 | 95.83 | |
| GDPOBackbone=Qwen3-8B-Base2026.05 | 1.67 | 100 |