Mathematical Reasoning on AIME (Result and Process Tracking)
26.67Result AccuracyStaRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| StaRPOModel=Qwen 7B2026.04 | 26.67 | 23.33 | |
| CPPOModel=Qwen 7B2026.04 | 23.33 | 20 | |
| GRPOModel=Qwen 7B2026.04 | 23.33 | 16.67 | |
| λ–GRPOModel=Qwen 7B2026.04 | 16.67 | 13.33 | |
| CPPOModel=Qwen 1.5B2026.04 | 13.33 | 10 | |
| EntropyModel=Qwen 7B2026.04 | 13.33 | 13.33 | |
| GRPOModel=Qwen 1.5B2026.04 | 10 | 10 | |
| StaRPOModel=Qwen 1.5B2026.04 | 10 | 10 | |
| OriginalModel=Qwen 7B2026.04 | 10 | 10 | |
| λ–GRPOModel=Qwen 1.5B2026.04 | 6.67 | 6.67 | |
| EntropyModel=Qwen 1.5B2026.04 | 6.67 | 6.67 | |
| PlannerModel=Qwen 7B2026.04 | 6.67 | 6.67 | |
| OriginalModel=Qwen 1.5B2026.04 | 3.33 | 3.33 | |
| PlannerModel=Qwen 1.5B2026.04 | 0 | 0 |