General Reasoning on Average (AMC23, ARC-C, GPQA, GSM8K)
4Delta AccuracyNCoTS (Ours)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| NCoTS (Ours)Model Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 4 | -22.3 | 1.595 | |
| NCoTS (Ours)Model Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 3.5 | -22.6 | 1.524 | |
| AdaptThinkModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 2.6 | -12.8 | 1.293 | |
| ThinkPruneModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 2.1 | -21.6 | 1.416 | |
| LaserModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 1.8 | -22 | 1.414 | |
| AdaptThinkModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 1.7 | -12 | 1.287 | |
| NoWaitModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 1.4 | -13.7 | 1.247 | |
| OriginalModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 0 | 0 | 1 | |
| NoWaitModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 0 | -17.2 | 1.22 | |
| OriginalModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 0 | 0 | 1 | |
| LaserModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | -0.7 | -16.9 | 1.214 | |
| MeanModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | -3 | -4.4 | 0.91 | |
| MeanModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | -4.3 | -3.2 | 0.873 |