Science Reasoning on GPQA Diamond (Response Length (Tokens))
6,858Response Length (Tokens)DeepSeek-R1-Distill
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeek-R1-DistillModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | 6,858 | |
| DeepSeek-R1-DistillModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | 6,582 | |
| AdaCoTModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | 3,993 | |
| AdaptThinkModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | 3,677 | |
| AdaCoTModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | 3,279 | |
| AdaptThinkModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | 2,914 | |
| S-GRPOModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | 2,828 | |
| S-GRPOModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | 2,453 | |
| LHRMsModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | 2,381 | |
| LHRMsModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | 2,042 | |
| SuCoModel Scale=1.5B, Base Model=Qwen2.5-Math2026.06 | 1,550 | |
| SuCoModel Scale=7B, Base Model=Qwen2.5-Math2026.06 | 1,389 |