Mathematical Reasoning on MATH (pass@16)
76.8Accuracy@16GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBase Model=Qwen3-8B2026.02 | 76.8 | 91.1 | |
| URSBase Model=Qwen3-8B2026.02 | 76.8 | 91.1 | |
| RPCBase Model=Qwen3-8B2026.02 | 76.4 | 91 | |
| RPCBase Model=Qwen2.5-Math-7B2026.02 | 67 | 80.7 | |
| VeriBoundK=5, Evaluation Mode=Empirical2026.06 | 66.5 | — | |
| FOVERK=52026.06 | 65.8 | — | |
| ReasonFlux-PRMK=52026.06 | 64.2 | — | |
| VeriBoundK=5, Evaluation Mode=Bound2026.06 | 64.1 | — | |
| R-PRMK=52026.06 | 63.4 | — | |
| Det. Trunc.Base Model=Qwen3-8B2026.02 | 63.3 | 90.2 | |
| PRM800KK=52026.06 | 62.1 | — | |
| GRPOBase Model=Qwen2.5-Math-7B2026.02 | 61 | 71 | |
| URSBase Model=Qwen2.5-Math-7B2026.02 | 61 | 74.1 | |
| Math-ShepherdK=52026.06 | 58.7 | — | |
| ORMK=52026.06 | 52.3 | — | |
| Det. Trunc.Base Model=Qwen2.5-Math-7B2026.02 | 36.1 | 42.3 | |
| DPSK-R1-Distill-1.5BBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=None2026.03 | — | 76.3 | |
| GRPOBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=GRPO2026.03 | — | 82.6 | |
| GRPOBase Model=Qwen2.5-Math-7B, Training Algorithm=GRPO2026.03 | — | 74 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Algorithm=None2026.03 | — | 60.1 | |
| ReValBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=ReVal2026.03 | — | 84.6 | |
| ReValBase Model=Qwen2.5-Math-7B, Training Algorithm=ReVal2026.03 | — | 75.2 | |
| TBRMBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=TBRM2026.03 | — | 81.3 | |
| TBRMBase Model=Qwen2.5-Math-7B, Training Algorithm=TBRM2026.03 | — | 74.4 |