Retrieval on Natural Questions (test)
92.1Top-5 RecallCoopRAG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| CoopRAGBackbone LLM=GPT-4o-mini2025.12 | 92.1 | — | — | — | — | 80.8 | |
| CoopRAGBackbone LLM=Llama3.3-70B2025.12 | 90.8 | — | — | — | — | 77.2 | |
| CoopRAGBackbone LLM=Gemma2-27B2025.12 | 89.5 | — | — | — | — | 72.8 | |
| CoopRAGBackbone LLM=Gemma2-9B2025.12 | 88.9 | — | — | — | — | 71.6 | |
| GAR best queryRetrieval Paradigm=Lexical Retrieval2023.05 | 81.9 | 88.1 | 92 | — | — | — | |
| HippoRAG2Backbone LLM=Llama3.3-70B2025.12 | 78 | — | — | — | — | 45.6 | |
| DPR-PAQBackbone=RoBERTa-large2021.08 | 76.9 | 84.7 | 89.2 | — | — | — | |
| GritLM-7B2025.12 | 76.6 | — | — | — | — | 46.2 | |
| HippoRAG2Backbone LLM=GPT-4o-mini2025.12 | 76.4 | — | — | — | — | 44.4 | |
| coCondenserBackbone=BERT-base2021.08 | 75.8 | 84.3 | 89 | — | — | — | |
| NV-Embed-v2Parameters=7B2025.12 | 75.4 | — | — | — | — | 45.3 | |
| DPR-PAQBackbone=BERT-large2021.08 | 75.3 | 84.4 | 88.9 | — | — | — | |
| DPR-PAQBackbone=BERT-base2021.08 | 74.5 | 83.7 | 88.6 | — | — | — | |
| HopRAGBackbone LLM=GPT-4o-mini2025.12 | 74.4 | — | — | — | — | 43.9 | |
| GTE-Qwen2-7B-Instruct2025.12 | 74.3 | — | — | — | — | 44.7 | |
| EAR-RD + DPRRetrieval Paradigm=Fusion (Dense + Lexical) Retrieval2023.05 | 74.2 | 83.1 | 89.3 | — | — | — | |
| DPR-PAQBackbone=RoBERTa-base2021.08 | 74.2 | 84 | 89.2 | — | — | — | |
| RocketQA2021.08 | 74 | 82.7 | 88.5 | — | — | — | |
| FiD-KDTraining Supervision=Supervised2021.12 | 73.8 | 84.3 | 89.3 | — | — | — | |
| Liu et al. (2022) + DPRRetrieval Paradigm=Fusion (Dense + Lexical) Retrieval2023.05 | 72.7 | 83 | 89.1 | — | — | — | |
| SiReRAGBackbone LLM=GPT-4o-mini2025.12 | 72.5 | — | — | — | — | 42.3 | |
| GAR + DPRRetrieval Paradigm=Fusion (Dense + Lexical) Retrieval2023.05 | 72.3 | 83.1 | 88.9 | — | — | — | |
| EAR-RI + DPRRetrieval Paradigm=Fusion (Dense + Lexical) Retrieval2023.05 | 71.1 | 82.5 | 89.1 | — | — | — | |
| HLPEvaluation protocol=fine-tuning2022.03 | 70.9 | 81.4 | 88 | — | — | — | |
| GAR+fusion=GAR + DPR2020.09 | 70.7 | 81.6 | 88.9 | 92 | 93.2 | — | |
| ICTEvaluation protocol=fine-tuning2022.03 | 69.8 | 81.1 | 87 | — | — | — | |
| WLPEvaluation protocol=fine-tuning2022.03 | 69.8 | 81.4 | 87.4 | — | — | — | |
| BM25 + DPRRetrieval Paradigm=Fusion (Dense + Lexical) Retrieval2023.05 | 69.7 | 81.2 | 88.2 | — | — | — | |
| RAPTORBackbone LLM=GPT-4o-mini2025.12 | 69.4 | — | — | — | — | 40.5 | |
| EAR-RDRetrieval Paradigm=Lexical Retrieval2023.05 | 69.3 | 78.6 | 86.5 | — | — | — | |
| ICT+WLP+BFS+Evaluation protocol=fine-tuning2022.03 | 68.9 | 80.9 | 87.7 | — | — | — | |
| BFS+Evaluation protocol=fine-tuning2022.03 | 68.7 | 80.1 | 86.5 | — | — | — | |
| No Pre-trainEvaluation protocol=fine-tuning2022.03 | 68.5 | 79.6 | 86.5 | — | — | — | |
| DPR2020.09 | 68.3 | 80.1 | 86.1 | 90.3 | 91.2 | — | |
| DPRRetrieval Paradigm=Dense Retrieval2023.05 | 68.3 | 80.1 | 86.1 | — | — | — | |
| RAPTORBackbone LLM=Llama3.3-70B2025.12 | 68.3 | — | — | — | — | 40.3 | |
| ColBERTv22025.12 | 64.3 | — | — | — | — | 36.8 | |
| Liu et al. (2022)Retrieval Paradigm=Lexical Retrieval2023.05 | 63.9 | 76.8 | 86.7 | — | — | — | |
| GTRBackbone=T5-base2025.12 | 63.4 | — | — | — | — | 35 | |
| EAR-RIRetrieval Paradigm=Lexical Retrieval2023.05 | 63.2 | 76.4 | 85.9 | — | — | — | |
| PropositionBase Retriever=ColBERTv22025.12 | 62.2 | — | — | — | — | 33.1 | |
| SEALRetrieval Paradigm=Lexical Retrieval2023.05 | 61.3 | 76.2 | 86.3 | — | — | — | |
| GAR2020.09 | 60.9 | 74.4 | 85.3 | 90.3 | 91.7 | — | |
| GAR2021.08 | 60.9 | 74.4 | 85.3 | — | — | — | |
| GARRetrieval Paradigm=Lexical Retrieval2023.05 | 60.8 | 73.9 | 84.7 | — | — | — | |
| BM252025.12 | 56.1 | — | — | — | — | 28.2 | |
| Contriever2025.12 | 54.6 | — | — | — | — | 29.1 | |
| HLPEvaluation protocol=zero-shot2022.03 | 51.2 | 70.2 | 82 | — | — | — | |
| ContrieverTraining Supervision=Unsupervised2021.12 | 47.8 | 67.8 | 82.1 | — | — | — | |
| HippoRAGBackbone LLM=GPT-4o-mini2025.12 | 45.1 | — | — | — | — | 21.6 | |
| BM25 + RM32020.09 | 44.6 | 64.2 | 79.6 | 86.8 | 88.9 | — | |
| HippoRAGBackbone LLM=Llama3.3-70B2025.12 | 44.4 | — | — | — | — | 21.3 | |
| BM25Retrieval Paradigm=Lexical Retrieval2023.05 | 43.8 | 62.9 | 78.3 | — | — | — | |
| BM25implementation=re-evaluated by authors2020.09 | 43.6 | 62.9 | 78.1 | 85.5 | 87.8 | — | |
| BM25Evaluation protocol=zero-shot2022.03 | 43.6 | 62.9 | 78.1 | — | — | — | |
| MSSEvaluation protocol=zero-shot2022.03 | 41.7 | 59.8 | 74.9 | — | — | — | |
| Masked salient spansTraining Supervision=Unsupervised2021.12 | 41.7 | 59.8 | 74.9 | — | — | — | |
| ICT+WLP+BFS+Evaluation protocol=zero-shot2022.03 | 32.3 | 50.2 | 68 | — | — | — | |
| Inverse Cloze TaskTraining Supervision=Unsupervised2021.12 | 32.3 | 50.9 | 66.8 | — | — | — | |
| BFS+Evaluation protocol=zero-shot2022.03 | 31 | 49.9 | 67.5 | — | — | — | |
| WLPEvaluation protocol=zero-shot2022.03 | 28.5 | 47.3 | 65.3 | — | — | — | |
| ICTEvaluation protocol=zero-shot2022.03 | 23.4 | 40.7 | 58.1 | — | — | — | |
| ANCE2020.12 | — | 82.1 | 87.9 | — | — | — | |
| ANCE2021.08 | — | 81.9 | 87.5 | — | — | — | |
| BM25Training Supervision=Unsupervised2021.12 | — | 62.9 | 78.3 | — | — | — | |
| BM252021.08 | — | 59.1 | 73.7 | — | — | — | |
| Condenser2021.08 | — | 83.2 | 88.4 | — | — | — | |
| DPR2020.12 | — | 79.4 | 86 | — | — | — | |
| DPRTraining Supervision=Supervised2021.12 | — | 78.4 | 85.4 | — | — | — | |
| DPR2021.08 | — | 74.4 | 85.3 | — | — | — | |
| Reader-to-Retriever Distillationinitial passages=BERT2020.12 | — | 68.8 | 79.5 | — | — | — | |
| Reader-to-Retriever Distillationinitial passages=BM252020.12 | — | 80 | 87.7 | — | — | — | |
| Reader-to-Retriever Distillationinitial passages=DPR2020.12 | — | 84.3 | 89.3 | — | — | — |