Mathematical Reasoning on OLYMPIAD (Pass@1, AvgToken)
42.2Pass@1 ScoreEurus-2-7B-PRIME
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Eurus-2-7B-PRIMEBackbone=Qwen2.5-Math-7B, Supervision Type=With Process Supervision2026.04 | 42.2 | 4,405 | |
| GRPO w/ Skywork-7BBackbone=Qwen2.5-Math-7B, Supervision Type=With Process Supervision2026.04 | 38.8 | 3,740 | |
| GRPO-VPSBackbone=Qwen2.5-Math-7B, Supervision Type=With Process Supervision2026.04 | 37.2 | 3,064 | |
| GRPOBackbone=Qwen2.5-Math-7B, Supervision Type=Outcome Supervision Only2026.04 | 36.8 | 3,527 | |
| GSPOBackbone=Qwen2.5-Math-7B, Supervision Type=Outcome Supervision Only2026.04 | 36.8 | 3,481 | |
| DrGRPOBackbone=Qwen2.5-Math-7B, Supervision Type=Outcome Supervision Only2026.04 | 35.9 | 3,490 | |
| S-GRPOBackbone=Qwen2.5-Math-7B, Supervision Type=With Process Supervision2026.04 | 35.8 | 3,123 | |
| GRPO-VPSBackbone=Qwen2.5-Math-1.5B, Supervision Type=With Process Supervision2026.04 | 32.1 | 3,326 | |
| DrGRPOBackbone=Qwen2.5-Math-1.5B, Supervision Type=Outcome Supervision Only2026.04 | 30.8 | 3,707 | |
| GRPOBackbone=Qwen2.5-Math-1.5B, Supervision Type=Outcome Supervision Only2026.04 | 30 | 3,811 | |
| GRPO w/ Skywork-1.5BBackbone=Qwen2.5-Math-1.5B, Supervision Type=With Process Supervision2026.04 | 29.8 | 3,403 | |
| GSPOBackbone=Qwen2.5-Math-1.5B, Supervision Type=Outcome Supervision Only2026.04 | 28.9 | 3,727 | |
| S-GRPOBackbone=Qwen2.5-Math-1.5B, Supervision Type=With Process Supervision2026.04 | 28.3 | 3,313 | |
| BASEBackbone=Qwen2.5-Math-1.5B, Supervision Type=Outcome Supervision Only2026.04 | 19 | 4,624 | |
| BASEBackbone=Qwen2.5-Math-7B, Supervision Type=Outcome Supervision Only2026.04 | 18.8 | 4,699 | |
| GRPO-VPSBackbone=Gemma-2-2B-it2026.04 | 6.2 | 2,396 | |
| GRPOBackbone=Gemma-2-2B-it2026.04 | 5.9 | 3,133 | |
| BASEBackbone=Gemma-2-2B-it2026.04 | 2.8 | 408 |