Mathematical Reasoning on AMC23 (Accuracy and Length Compliance)
65.21AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBackbone=Qwen3-8B-Base2026.05 | 65.21 | 64.83 | |
| DVAOBackbone=Qwen3-8B-Base2026.05 | 60.54 | 99.85 | |
| Reward Combination (RC)Backbone=Qwen3-8B-Base2026.05 | 59.33 | 99.02 | |
| Advantage Combination (AC)Backbone=Qwen3-8B-Base2026.05 | 58.13 | 99.02 | |
| DVAOBackbone=Qwen3-4B-Base2026.05 | 53.53 | 99.85 | |
| Reward Combination (RC)Backbone=Qwen3-4B-Base2026.05 | 51.5 | 97.67 | |
| GRPOBackbone=Qwen3-4B-Base2026.05 | 49.62 | 82.91 | |
| Advantage Combination (AC)Backbone=Qwen3-4B-Base2026.05 | 49.47 | 98.12 | |
| Qwen3 Base ModelBackbone=Qwen3-8B-Base2026.05 | 41.56 | 96.16 | |
| Qwen3 Base ModelBackbone=Qwen3-4B-Base2026.05 | 34.18 | 91.94 | |
| GDPOBackbone=Qwen3-8B-Base2026.05 | 27.56 | 100 | |
| GDPOBackbone=Qwen3-4B-Base2026.05 | 14.6 | 98.95 |