Question Answering on SQuAD (EM, F1, Trigger Ratio)
29.13EMDTR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DTRGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Uncertainty threshold (u)=0.0052026.01 | 29.13 | 37.65 | 93.6 | |
| DTRGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Uncertainty threshold (u)=0.0012026.01 | 29.11 | 37.68 | 96.8 | |
| DTRGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Uncertainty threshold (u)=0.012026.01 | 29.02 | 37.47 | 91.2 | |
| Standard RAGGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=32026.01 | 28.84 | 37.43 | — | |
| Q2DGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=32026.01 | 27.34 | 35.93 | — | |
| CoTGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=32026.01 | 27.09 | 35.57 | — | |
| LLM JudgeGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Judge Model=72B2026.01 | 26.37 | 34.44 | 70 | |
| HyDEGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=32026.01 | 24.52 | 32.62 | — | |
| LLM JudgeGenerator=Qwen2.5-7B-Instruct, Retriever=e5, Top-k retrievals=3, Judge Model=7B2026.01 | 12.21 | 18.65 | 0 | |
| No RetrievalGenerator=Qwen2.5-7B-Instruct, Retriever=None, Top-k retrievals=02026.01 | 12.2 | 18.63 | — |