Mathematical Reasoning on AMC 23 (Acc, Length, η)
62.5AccuracyReSum
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ReSumBackbone=Qwen2.5-Math-7B2026.06 | 62.5 | — | — | |
| DGPOBackbone=Qwen2.5-Math-7B2026.06 | 61.02 | — | — | |
| GSPOBackbone=Qwen2.5-Math-7B2026.06 | 60.16 | — | — | |
| GPGBackbone=Qwen2.5-Math-7B2026.06 | 59.61 | — | — | |
| GRPO-ADBackbone=Qwen2.5-Math-7B2026.06 | 59.06 | — | — | |
| GRPOBackbone=Qwen2.5-Math-7B2026.06 | 58.98 | — | — | |
| Dr. GRPOBackbone=Qwen2.5-Math-7B2026.06 | 58.59 | — | — | |
| DAPOBackbone=Qwen2.5-Math-7B2026.06 | 58.2 | — | — | |
| NCoTS (Ours)Model Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 52.5 | 1,700 | 1.538 | |
| ReSumBackbone=Qwen2.5-Math-1.5B2026.06 | 51.33 | — | — | |
| NoWaitModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 50 | 1,894 | 1.252 | |
| LaserModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 50 | 1,650 | 1.437 | |
| DGPOBackbone=Qwen2.5-Math-1.5B2026.06 | 49.84 | — | — | |
| NCoTS (Ours)Model Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 47.5 | 1,884 | 1.578 | |
| AdaptThinkModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 47.5 | 1,910 | 1.121 | |
| GRPOBackbone=Qwen2.5-Math-1.5B2026.06 | 46.48 | — | — | |
| ThinkPruneModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 45 | 1,803 | 1.48 | |
| OriginalModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 45 | 1,921 | 1 | |
| AdaptThinkModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 42.5 | 1,926 | 1.236 | |
| OriginalModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 40 | 2,109 | 1 | |
| NoWaitModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 40 | 1,967 | 1.072 | |
| LaserModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 40 | 1,902 | 1.109 | |
| ReSumBackbone=Qwen2.5-3B2026.06 | 39.06 | — | — | |
| MeanModel Backbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 37.3 | 1,974 | 0.669 | |
| DGPOBackbone=Qwen2.5-3B2026.06 | 36.56 | — | — | |
| Base ModelBackbone=Qwen2.5-Math-7B2026.06 | 35.23 | — | — | |
| MeanModel Backbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 35 | 2,083 | 0.775 | |
| GRPOBackbone=Qwen2.5-3B2026.06 | 33.28 | — | — | |
| Base ModelBackbone=Qwen2.5-Math-1.5B2026.06 | 30.94 | — | — | |
| Base ModelBackbone=Qwen2.5-3B2026.06 | 22.66 | — | — | |
| ReSumBackbone=DeepSeek-Math-7B2026.06 | 22.4 | — | — | |
| DGPOBackbone=DeepSeek-Math-7B2026.06 | 21.02 | — | — | |
| GRPOBackbone=DeepSeek-Math-7B2026.06 | 19.14 | — | — | |
| Base ModelBackbone=DeepSeek-Math-7B2026.06 | 13.28 | — | — |