Multi-hop Reasoning on HotpotQA (Recall@2, Recall@5, SR)
72.65Recall@2HeadRank
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| HeadRankModel=Qwen3-4B, Method=HeadRank2026.04 | 72.65 | 86.45 | 100 | |
| RankGPTModel=GPT-3.5 Turbo, Method=RankGPT2026.04 | 71.8 | 84.9 | 98.6 | |
| RankGPTModel=Qwen3-4B, Method=RankGPT2026.04 | 71.6 | 84.25 | 98.9 | |
| RankGPTModel=Llama-3.1 8B, Method=RankGPT2026.04 | 69.9 | 84.8 | 98.2 | |
| HeadRankModel=Qwen3-1.7B, Method=HeadRank2026.04 | 69.35 | 86.2 | 100 | |
| HeadRankModel=Qwen3-0.6B, Method=HeadRank2026.04 | 67.5 | 85.25 | 100 | |
| ICRModel=Qwen3-1.7B, Method=ICR2026.04 | 66.95 | 82.1 | 100 | |
| RankGPTModel=Mistral 7B, Method=RankGPT2026.04 | 64.8 | 79.8 | 20.5 | |
| ColBERTv2Method=ColBERTv22026.04 | 64.65 | 79.3 | — | |
| ICRModel=Qwen3-0.6B, Method=ICR2026.04 | 57.5 | 75.35 | 100 | |
| ICRModel=Qwen3-4B, Method=ICR2026.04 | 57.45 | 74.2 | 100 | |
| RankGPTModel=Qwen3-1.7B, Method=RankGPT2026.04 | 57.25 | 73.2 | 93.7 | |
| RankGPTModel=Qwen3-0.6B, Method=RankGPT2026.04 | 52.85 | 62.9 | 80.1 |