Mathematical Reasoning on MATH 500 (Pass@1 Accuracy, Average)
88.4Pass@1 AccuracyUP-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UP-GRPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 88.4 | 61.31 | |
| GSPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 88.2 | 60.15 | |
| ASPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 87.6 | 59.67 | |
| SAPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 87.2 | 59.23 | |
| GMPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 87 | 59.66 | |
| CISPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 86.6 | 59.36 | |
| DPPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 86.2 | 59.52 | |
| GRPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 86 | 55.79 | |
| Dr. GRPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 85.8 | 57.09 | |
| W-REINFORCEBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 85.8 | 56.95 | |
| RLOOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 85.2 | 55.23 | |
| REINFORCE++Backbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 78.8 | 46.77 |