Multi-hop Question Answering on HotpotQA (Mean Accuracy)
73.7Mean AccuracyDiSCTT
Evaluation Results
| Method | Links | |
|---|---|---|
| DiSCTTModel=Qwen-2.5-7B-Instruct2026.03 | 73.7 | |
| DiSCTTModel=Qwen-3-4B-Base2026.03 | 72.9 | |
| DiSCTTModel=Qwen-3-1.7B-Base2026.03 | 67.1 | |
| DiSCTTModel=LLaMA-3.2-3B-Instruct2026.03 | 66.7 | |
| EVOL-RLModel=Qwen-3-4B-Base2026.03 | 66.3 | |
| EVOL-RLModel=Qwen-2.5-7B-Instruct2026.03 | 66.1 | |
| TTRLModel=Qwen-2.5-7B-Instruct2026.03 | 62.1 | |
| EVOL-RLModel=LLaMA-3.2-3B-Instruct2026.03 | 61.7 | |
| TTRLModel=Qwen-3-4B-Base2026.03 | 61.5 | |
| TTRLModel=LLaMA-3.2-3B-Instruct2026.03 | 57.3 | |
| EVOL-RLModel=Qwen-3-1.7B-Base2026.03 | 56.4 | |
| BaseModel=Qwen-2.5-7B-Instruct2026.03 | 51.2 | |
| TTRLModel=Qwen-3-1.7B-Base2026.03 | 49.2 | |
| DiSCTTModel=LLaMA-3.2-1B-Instruct2026.03 | 40.3 | |
| BaseModel=LLaMA-3.2-3B-Instruct2026.03 | 39.9 | |
| BaseModel=Qwen-3-4B-Base2026.03 | 39.4 | |
| EVOL-RLModel=LLaMA-3.2-1B-Instruct2026.03 | 31.4 | |
| BaseModel=Qwen-3-1.7B-Base2026.03 | 25.4 | |
| TTRLModel=LLaMA-3.2-1B-Instruct2026.03 | 23.3 | |
| DiSCTTModel=Qwen-2.5-0.5B-Instruct2026.03 | 18.7 | |
| EVOL-RLModel=Qwen-2.5-0.5B-Instruct2026.03 | 13.7 | |
| BaseModel=LLaMA-3.2-1B-Instruct2026.03 | 11.7 | |
| TTRLModel=Qwen-2.5-0.5B-Instruct2026.03 | 10.3 | |
| BaseModel=Qwen-2.5-0.5B-Instruct2026.03 | 1.2 |