Mathematical Reasoning on AMC 23 (Pass@1 Accuracy and Average)
87.5Pass@1 AccuracyCISPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CISPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 87.5 | 59.36 | |
| DPPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 87.5 | 59.52 | |
| GMPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 87.5 | 59.66 | |
| UP-GRPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 87.5 | 61.31 | |
| Dr. GRPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 85 | 57.09 | |
| GSPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 85 | 60.15 | |
| ASPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 85 | 59.67 | |
| SAPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 82.5 | 59.23 | |
| RLOOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 80 | 55.23 | |
| W-REINFORCEBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 80 | 56.95 | |
| GRPOBackbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 75 | 55.79 | |
| REINFORCE++Backbone=Qwen3-8B, Training Dataset=MATH (Levels 3-5), Training Protocol=Liu et al. [18]2026.07 | 62.5 | 46.77 |