Mathematical Reasoning on OlympiadBench (Accuracy, Length Compliance)
55.57AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBackbone=Qwen3-8B-Base2026.05 | 55.57 | 70.81 | |
| DVAOBackbone=Qwen3-8B-Base2026.05 | 50.62 | 99.76 | |
| Reward Combination (RC)Backbone=Qwen3-8B-Base2026.05 | 49.73 | 98.48 | |
| Advantage Combination (AC)Backbone=Qwen3-8B-Base2026.05 | 48.52 | 98.93 | |
| DVAOBackbone=Qwen3-4B-Base2026.05 | 45.63 | 99.96 | |
| GRPOBackbone=Qwen3-4B-Base2026.05 | 42.88 | 82.82 | |
| Reward Combination (RC)Backbone=Qwen3-4B-Base2026.05 | 41.18 | 97.43 | |
| Advantage Combination (AC)Backbone=Qwen3-4B-Base2026.05 | 41.02 | 98.08 | |
| Qwen3 Base ModelBackbone=Qwen3-8B-Base2026.05 | 34.95 | 94.66 | |
| Qwen3 Base ModelBackbone=Qwen3-4B-Base2026.05 | 26.98 | 92.02 | |
| GDPOBackbone=Qwen3-4B-Base2026.05 | 16.56 | 98.29 | |
| GDPOBackbone=Qwen3-8B-Base2026.05 | 9.15 | 99.96 |