Question Answering on HotpotQA (EM, F1, Trigger Ratio)
36.73EMDTR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DTRGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Uncertainty threshold (u)=0.0012026.01 | 36.73 | 47.34 | 87.7 | |
| DTRGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Uncertainty threshold (u)=0.0052026.01 | 36.29 | 46.87 | 83.5 | |
| DTRGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Uncertainty threshold (u)=0.012026.01 | 36.21 | 46.71 | 81 | |
| Standard RAGGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=32026.01 | 35.18 | 45.77 | — | |
| Q2DGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=32026.01 | 34.54 | 44.44 | — | |
| CoTGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=32026.01 | 34.44 | 44.57 | — | |
| LLM JudgeGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Judge Model=72B2026.01 | 33.6 | 43.83 | 88.7 | |
| HyDEGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=32026.01 | 32.64 | 42.4 | — | |
| LLM JudgeGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Judge Model=7B2026.01 | 18.77 | 25.46 | 0.5 | |
| No RetrievalGenerator=Qwen2.5-7B-Instruct, Retriever=None, Top-k retrievals=02026.01 | 18.73 | 25.38 | — |