Mathematical Reasoning on GSM8K (Accuracy and Token Count Analysis)
0.9522AccuracyBaseline
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| BaselineBackbone=QwQ-32B, Temperature=0.02025.12 | 0.9522 | — | 1,406.12 | — | |
| LYNXBackbone=QwQ-32B, Conf=0.97, Temperature=0.02025.12 | 0.9477 | -0.47 | 1,210.53 | -13.9 | |
| DEERBackbone=QwQ-32B, Temperature=0.02025.12 | 0.9431 | -0.96 | 896.41 | -36.2 | |
| LYNXBackbone=QwQ-32B, Conf=0.95, Temperature=0.02025.12 | 0.9371 | -1.59 | 1,046.63 | -25.6 | |
| LYNXBackbone=QwQ-32B, Conf=0.90, Temperature=0.02025.12 | 0.9272 | -2.63 | 941.72 | -33 | |
| LYNXBackbone=QwQ-32B, Conf=0.80, Temperature=0.02025.12 | 0.9037 | -5.09 | 770.66 | -45.2 | |
| LYNXBackbone=QwQ-32B, Conf=0.70, Temperature=0.02025.12 | 0.8408 | -11.7 | 596.82 | -57.6 | |
| ToNBackbone=QwQ-32B, Temperature=0.02025.12 | 0.8021 | -15.76 | 1,174.29 | -16.5 | |
| LYNXBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Conf=0.95, Temperature=0.02025.12 | 0.7877 | 3.69 | 1,059.88 | -39.5 | |
| LYNXBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Conf=0.90, Temperature=0.02025.12 | 0.787 | 3.59 | 792.24 | -54.8 | |
| LYNXBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Conf=0.97, Temperature=0.02025.12 | 0.7847 | 3.29 | 1,265.35 | -27.7 | |
| LYNXBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Conf=0.80, Temperature=0.02025.12 | 0.768 | 1.09 | 591.13 | -66.2 | |
| BaselineBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Temperature=0.02025.12 | 0.7597 | — | 1,751.23 | — | |
| LYNXBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Conf=0.70, Temperature=0.02025.12 | 0.7316 | -3.7 | 529.66 | -69.8 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Temperature=0.02025.12 | 0.6914 | -8.99 | 716.45 | -59.1 | |
| ToNBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Temperature=0.02025.12 | 0.6793 | -10.58 | 893.04 | -49 | |
| CoTBackbone=Qwen2.5-Math-1.5B, LoRA rank=16, Internalization curriculum=Stepwise, Reasoning method=CoT2026.06 | 0.635 | — | 105 | — | |
| TILRBackbone=Qwen2.5-Math-1.5B, LoRA rank=16, Internalization curriculum=Stepwise, Reasoning method=TILR2026.06 | 0.605 | — | 9 | — | |
| RefinementBackbone=Qwen2.5-Math-1.5B, LoRA rank=16, Internalization curriculum=Stepwise, Reasoning method=Refinement2026.06 | 0.581 | — | 9 | — | |
| CoconutBackbone=Qwen2.5-Math-1.5B, LoRA rank=16, Internalization curriculum=Stepwise, Reasoning method=Coconut2026.06 | 0.562 | — | 9 | — | |
| AdaAnchorBackbone=Qwen2.5-Math-1.5B, LoRA rank=16, Internalization curriculum=Stepwise, Reasoning method=AdaAnchor2026.06 | 0.485 | — | 7 | — | |
| No-CoTBackbone=Qwen2.5-Math-1.5B, LoRA rank=16, Internalization curriculum=Stepwise, Reasoning method=No-CoT2026.06 | 0.354 | — | 3 | — |