Mathematical Reasoning on Minerva (Pass@1 accuracy, Average)
31.25Pass@1 AccuracyGMPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GMPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 31.25 | 59.66 | |
| GSPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 31.25 | 60.15 | |
| UP-GRPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 31.25 | 61.31 | |
| GRPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 30.88 | 55.79 | |
| SAPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 30.88 | 59.23 | |
| DPPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 30.51 | 59.52 | |
| Dr. GRPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 30.15 | 57.09 | |
| W-REINFORCEBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 30.15 | 56.95 | |
| REINFORCE++Backbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 29.78 | 46.77 | |
| ASPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 29.78 | 59.67 | |
| CISPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 29.04 | 59.36 | |
| RLOOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 28.68 | 55.23 |