Question Answering on TriviaQA (Positional Accuracy Metrics)
73.4Accuracy (Benign)MIS/Sampling + MIS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MIS/Sampling + MISModel=GPT-4o-mini, Number of retrieved documents (k)=102025.09 | 73.4 | 59 | 70.6 | |
| Vanilla RAGModel=GPT-4o-mini, Number of retrieved documents (k)=102025.09 | 72.8 | 25.4 | 39.8 | |
| InstructRAGModel=Mistral-7B, Number of retrieved documents (k)=102025.09 | 72.2 | 40.4 | 21.2 | |
| AstuteRAGModel=GPT-4o-mini, Number of retrieved documents (k)=102025.09 | 70.2 | 66.4 | 66.4 | |
| InstructRAGModel=Llama3.2-3B, Number of retrieved documents (k)=102025.09 | 70 | 15 | 20.4 | |
| InstructRAGModel=GPT-4o-mini, Number of retrieved documents (k)=102025.09 | 69 | 49.6 | 48.4 | |
| Vanilla RAGModel=Mistral-7B, Number of retrieved documents (k)=102025.09 | 68.6 | 34.6 | 8.6 | |
| AstuteRAGModel=Llama3.2-3B, Number of retrieved documents (k)=102025.09 | 68.2 | 22.2 | 18 | |
| RobustRAGModel=GPT-4o-mini, Number of retrieved documents (k)=102025.09 | 67.8 | 62.4 | 65 | |
| MIS/Sampling + MISModel=Mistral-7B, Number of retrieved documents (k)=102025.09 | 65.4 | 57.8 | 59.2 | |
| Vanilla RAGModel=Llama3.2-3B, Number of retrieved documents (k)=102025.09 | 65.2 | 31.6 | 8.6 | |
| MIS/Sampling + MISModel=Llama3.2-3B, Number of retrieved documents (k)=102025.09 | 65 | 60 | 62.6 | |
| AstuteRAGModel=Mistral-7B, Number of retrieved documents (k)=102025.09 | 61.8 | 52.6 | 41 | |
| RobustRAGModel=Mistral-7B, Number of retrieved documents (k)=102025.09 | 60.8 | 57.4 | 58.6 | |
| RobustRAGModel=Llama3.2-3B, Number of retrieved documents (k)=102025.09 | 60.8 | 59.2 | 60 |