Multi-hop Reasoning on StrategyQA (Exact-match accuracy, Generation tokens)
70.3Exact-match AccuracyTILR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TILRBackbone=Qwen2.5-Math-1.5B, LoRA rank=16, Internalization curriculum=Stepwise, Reasoning method=TILR2026.06 | 70.3 | 2 | |
| RefinementBackbone=Qwen2.5-Math-1.5B, LoRA rank=16, Internalization curriculum=Stepwise, Reasoning method=Refinement2026.06 | 67.3 | 2 | |
| CoconutBackbone=Qwen2.5-Math-1.5B, LoRA rank=16, Internalization curriculum=Stepwise, Reasoning method=Coconut2026.06 | 65.4 | 2 | |
| CoTBackbone=Qwen2.5-Math-1.5B, LoRA rank=16, Internalization curriculum=Stepwise, Reasoning method=CoT2026.06 | 63.1 | 32 | |
| AdaAnchorBackbone=Qwen2.5-Math-1.5B, LoRA rank=16, Internalization curriculum=Stepwise, Reasoning method=AdaAnchor2026.06 | 61.6 | 2 | |
| No-CoTBackbone=Qwen2.5-Math-1.5B, LoRA rank=16, Internalization curriculum=Stepwise, Reasoning method=No-CoT2026.06 | 57.9 | 1 |