Mathematical Reasoning on MATH500 (Accuracy, Length Compliance)
87.93AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBackbone=Qwen3-8B-Base2026.05 | 87.93 | 89.61 | |
| DVAOBackbone=Qwen3-8B-Base2026.05 | 86.1 | 99.99 | |
| Reward Combination (RC)Backbone=Qwen3-8B-Base2026.05 | 84.97 | 99.59 | |
| Advantage Combination (AC)Backbone=Qwen3-8B-Base2026.05 | 84.42 | 99.58 | |
| DVAOBackbone=Qwen3-4B-Base2026.05 | 81.36 | 99.94 | |
| GRPOBackbone=Qwen3-4B-Base2026.05 | 78.92 | 93.04 | |
| Reward Combination (RC)Backbone=Qwen3-4B-Base2026.05 | 78.31 | 98.91 | |
| Advantage Combination (AC)Backbone=Qwen3-4B-Base2026.05 | 77.65 | 98.69 | |
| Qwen3 Base ModelBackbone=Qwen3-8B-Base2026.05 | 69.2 | 97.44 | |
| Qwen3 Base ModelBackbone=Qwen3-4B-Base2026.05 | 55.05 | 91.42 | |
| GDPOBackbone=Qwen3-8B-Base2026.05 | 35.07 | 100 | |
| GDPOBackbone=Qwen3-4B-Base2026.05 | 30.06 | 99.52 |