Reasoning-based Question Answering on GPQA (avg@16)
33.3Avg@16 ScoreReVal
Evaluation Results
| Method | Links | |
|---|---|---|
| ReValBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=ReVal2026.03 | 33.3 | |
| GRPOBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=GRPO2026.03 | 28.8 | |
| TBRMBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=TBRM2026.03 | 27.3 | |
| ReValBase Model=Qwen2.5-Math-7B, Training Algorithm=ReVal2026.03 | 24.8 | |
| GRPOBase Model=Qwen2.5-Math-7B, Training Algorithm=GRPO2026.03 | 20.4 | |
| TBRMBase Model=Qwen2.5-Math-7B, Training Algorithm=TBRM2026.03 | 19.9 | |
| DPSK-R1-Distill-1.5BBase Model=DPSK-R1-Distill-1.5B, Training Algorithm=None2026.03 | 15.8 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Algorithm=None2026.03 | 12.8 |