Mathematical Reasoning on OlympiadBench (Pass@1 accuracy, Average)
58.48Pass@1 AccuracyASPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ASPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 58.48 | 59.67 | |
| UP-GRPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 58.33 | 61.31 | |
| GSPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 55.8 | 60.15 | |
| CISPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 55.65 | 59.36 | |
| SAPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 55.65 | 59.23 | |
| GMPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 55.06 | 59.66 | |
| DPPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 53.27 | 59.52 | |
| W-REINFORCEBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 53.27 | 56.95 | |
| GRPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 51.34 | 55.79 | |
| Dr. GRPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 51.19 | 57.09 | |
| RLOOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 50.6 | 55.23 | |
| REINFORCE++Backbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 42.26 | 46.77 |