Mathematical Reasoning on MATH (Pass@1, AvgToken)
78.3Pass@1 AccuracyEurus-2-7B-PRIME
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Eurus-2-7B-PRIMEBackbone=Qwen2.5-Math-7B, Supervision Type=With Process Supervision2026.04 | 78.3 | 3,024 | |
| GRPO w/ Skywork-7BBackbone=Qwen2.5-Math-7B, Supervision Type=With Process Supervision2026.04 | 75.6 | 2,736 | |
| GRPO-VPSBackbone=Qwen2.5-Math-7B, Supervision Type=With Process Supervision2026.04 | 75.6 | 2,372 | |
| DrGRPOBackbone=Qwen2.5-Math-7B, Supervision Type=Outcome Supervision Only2026.04 | 75.5 | 2,700 | |
| GRPOBackbone=Qwen2.5-Math-7B, Supervision Type=Outcome Supervision Only2026.04 | 75.4 | 2,671 | |
| GSPOBackbone=Qwen2.5-Math-7B, Supervision Type=Outcome Supervision Only2026.04 | 75.2 | 2,661 | |
| S-GRPOBackbone=Qwen2.5-Math-7B, Supervision Type=With Process Supervision2026.04 | 74.9 | 2,464 | |
| GRPO-VPSBackbone=Qwen2.5-Math-1.5B, Supervision Type=With Process Supervision2026.04 | 72.2 | 2,391 | |
| GRPO w/ Skywork-1.5BBackbone=Qwen2.5-Math-1.5B, Supervision Type=With Process Supervision2026.04 | 71.4 | 2,758 | |
| DrGRPOBackbone=Qwen2.5-Math-1.5B, Supervision Type=Outcome Supervision Only2026.04 | 70.5 | 2,757 | |
| GRPOBackbone=Qwen2.5-Math-1.5B, Supervision Type=Outcome Supervision Only2026.04 | 68.8 | 2,749 | |
| GSPOBackbone=Qwen2.5-Math-1.5B, Supervision Type=Outcome Supervision Only2026.04 | 68 | 2,778 | |
| S-GRPOBackbone=Qwen2.5-Math-1.5B, Supervision Type=With Process Supervision2026.04 | 67.5 | 2,664 | |
| BASEBackbone=Qwen2.5-Math-7B, Supervision Type=Outcome Supervision Only2026.04 | 31.9 | 4,370 | |
| GRPO-VPSBackbone=Gemma-2-2B-it2026.04 | 31.6 | 2,212 | |
| GRPOBackbone=Gemma-2-2B-it2026.04 | 31 | 2,938 | |
| BASEBackbone=Qwen2.5-Math-1.5B, Supervision Type=Outcome Supervision Only2026.04 | 22.6 | 5,008 | |
| BASEBackbone=Gemma-2-2B-it2026.04 | 21.3 | 345 |