Question Answering on GPQA (Acc, Length, η)
44.1AccuracyLUFFY
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LUFFY2025.06 | 44.1 | 3,285 | — | |
| ReLIFT2025.06 | 43.1 | 3,177 | — | |
| AdaptThinkModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 42.2 | 2,393 | 1.218 | |
| NCoTS (Ours)Model Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 41.1 | 2,192 | 1.261 | |
| RL2025.06 | 40.1 | 1,881 | — | |
| OriginalModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 38.9 | 2,474 | 1 | |
| NoWaitModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 38.9 | 2,248 | 1.101 | |
| LaserModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 38.9 | 2,279 | 1.086 | |
| MeanModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 35 | 2,320 | 0.864 | |
| SFT then RL(v2)2025.06 | 33.9 | 4,490 | — | |
| AdaptThinkModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 32.2 | 2,429 | 1.032 | |
| NCoTS (Ours)Model Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 32.2 | 2,007 | 1.249 | |
| OriginalModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 31.1 | 2,339 | 1 | |
| ThinkPruneModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 31.1 | 1,900 | 1.231 | |
| MeanModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 28.9 | 2,181 | 0.926 | |
| NoWaitModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 28.9 | 1,992 | 1.014 | |
| SFT then RL(v1)2025.06 | 28.9 | 3,779 | — | |
| LaserModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 27.8 | 2,121 | 0.881 | |
| RL w/ SFT Loss2025.06 | 27.4 | 5,942 | — | |
| SFT2025.06 | 26.5 | 6,547 | — | |
| Qwen-Math2025.06 | 26.4 | 1,110 | — | |
| Qwen-Math-Instruct2025.06 | 22.8 | 5,071 | — |