Multi-hop Question Answering on HotpotQA (EM, F1, P, R)
0.601EMSTRIDE-FT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| STRIDE-FTBackbone=Qwen3-8B, Fine-tuning=true2026.04 | 0.601 | 0.691 | 0.723 | 0.682 | |
| DualRAGBackbone=GPT-4o-mini, Fine-tuning=false2026.04 | 0.578 | 0.679 | 0.691 | 0.694 | |
| STRIDEBackbone=GPT-4o-mini, Fine-tuning=false2026.04 | 0.564 | 0.671 | 0.683 | 0.695 | |
| DualRAGBackbone=Qwen3-8B, Fine-tuning=false2026.04 | 0.552 | 0.658 | 0.666 | 0.701 | |
| Iter-RetGenBackbone=GPT-4o-mini, Fine-tuning=false2026.04 | 0.551 | 0.668 | 0.676 | 0.723 | |
| STRIDEBackbone=Qwen3-8B, Fine-tuning=false2026.04 | 0.549 | 0.653 | 0.662 | 0.681 | |
| GenGroundBackbone=Qwen3-8B, Fine-tuning=false2026.04 | 0.523 | 0.628 | 0.636 | 0.664 | |
| RAG w/ CoTBackbone=GPT-4o-mini, Fine-tuning=false2026.04 | 0.522 | 0.633 | 0.646 | 0.669 | |
| Iter-RetGenBackbone=Qwen3-8B, Fine-tuning=false2026.04 | 0.519 | 0.619 | 0.633 | 0.634 | |
| RAG w/ CoTBackbone=Qwen3-8B, Fine-tuning=false2026.04 | 0.501 | 0.602 | 0.616 | 0.625 | |
| GenGroundBackbone=GPT-4o-mini, Fine-tuning=false2026.04 | 0.48 | 0.623 | 0.613 | 0.705 | |
| SelfAskBackbone=Qwen3-8B, Fine-tuning=false2026.04 | 0.449 | 0.52 | 0.529 | 0.542 | |
| CoTBackbone=GPT-4o-mini, Fine-tuning=false2026.04 | 0.346 | 0.441 | 0.459 | 0.442 | |
| CoTBackbone=Qwen3-8B, Fine-tuning=false2026.04 | 0.22 | 0.303 | 0.311 | 0.324 |