Question Answering on GPQA (OOD) (Accuracy, # Tokens)
28.88AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBase Model=DeepScaleR-1.5B2026.02 | 28.88 | 2,229 | |
| L1-MaxBase Model=DeepScaleR-1.5B2026.02 | 28.72 | 1,773 | |
| LACONICBase Model=DeepScaleR-1.5B2026.02 | 27.2 | 1,167 | |
| ThinkPrune-Iter2kBase Model=DeepScaleR-1.5B2026.02 | 27.02 | 1,791 | |
| L1-ExactBase Model=DeepScaleR-1.5B2026.02 | 22.88 | 1,475 |