Question Answering on TriviaQA (EM, F1, Trigger Ratio)
61.61EMDTR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DTRGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Uncertainty threshold (u)=0.012026.01 | 61.61 | 69.46 | 78.7 | |
| DTRGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Uncertainty threshold (u)=0.0052026.01 | 61.54 | 69.49 | 83 | |
| DTRGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Uncertainty threshold (u)=0.0012026.01 | 61.26 | 69.4 | 90.8 | |
| Standard RAGGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=32026.01 | 59 | 66.99 | — | |
| Q2DGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=32026.01 | 57.48 | 65.29 | — | |
| CoTGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=32026.01 | 57.39 | 65.26 | — | |
| HyDEGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=32026.01 | 55.31 | 63.17 | — | |
| LLM JudgeGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Judge Model=72B2026.01 | 51.26 | 57.82 | 27.8 | |
| LLM JudgeGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Judge Model=7B2026.01 | 43.27 | 49.15 | 0.1 | |
| No RetrievalGenerator=Qwen2.5-7B-Instruct, Retriever=None, Top-k retrievals=02026.01 | 43.24 | 49.12 | — |