General Reasoning on BBH (Acc, Peak, Dep)
73.2Accuracy (BBH)LThinker++
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LThinker++Model Series=Llama3.1-8B, Budget setting=true2026.04 | 73.2 | 1,481 | 4,600,000 | |
| TokenSkipModel Series=Llama3.1-8B, Budget setting=true2026.04 | 69.16 | 2,581 | 7,600,000 | |
| VanillaModel Series=Llama3.1-8B, Budget setting=true2026.04 | 67.95 | 2,606 | 7,500,000 | |
| CoTModel Series=Llama3.1-8B, Budget setting=true2026.04 | 66.46 | 642 | 200,000 | |
| CoTModel Series=Qwen2.5-7B, Budget setting=true2026.04 | 65.45 | 570 | 100,000 | |
| LThinker++Model Series=Qwen2.5-7B, Budget setting=true2026.04 | 63.77 | 1,415 | 4,200,000 | |
| LThinker*Model Series=Llama3.1-8B, Budget setting=true2026.04 | 63.1 | 1,664 | 8,100,000 | |
| VanillaModel Series=Qwen2.5-7B, Budget setting=true2026.04 | 62.76 | 2,714 | 8,200,000 | |
| Distill-R1Model Series=Llama3.1-8B, Budget setting=true2026.04 | 61.21 | 380 | 200,000 | |
| TokenSkipModel Series=Qwen2.5-7B, Budget setting=true2026.04 | 59.87 | 2,850 | 9,300,000 | |
| Distill-R1Model Series=Qwen2.5-7B, Budget setting=true2026.04 | 57.78 | 1,967 | 6,000,000 | |
| LThinker*Model Series=Qwen2.5-7B, Budget setting=true2026.04 | 56.63 | 1,580 | 7,000,000 |