Aggregated Reasoning Evaluation on Overall Average
45.6Average Score @ 16ReVal
Evaluation Results
| Method | Links | |
|---|---|---|
| ReValBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=ReVal2026.03 | 45.6 | |
| GRPOBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=GRPO2026.03 | 43.4 | |
| TBRMBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=TBRM2026.03 | 42.3 | |
| ReValBase Model=Qwen2.5-Math-7B, Training Algorithm=ReVal2026.03 | 39.6 | |
| GRPOBase Model=Qwen2.5-Math-7B, Training Algorithm=GRPO2026.03 | 38.4 | |
| TBRMBase Model=Qwen2.5-Math-7B, Training Algorithm=TBRM2026.03 | 36.9 | |
| DPSK-R1-Distill-1.5BBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=None2026.03 | 34.7 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Algorithm=None2026.03 | 25.7 |