Question Answering on PopQA (Exact Match)
64.2Exact MatchMASS-RAG-Llama3 8B
Evaluation Results
| Method | Links | |
|---|---|---|
| MASS-RAG-Llama3 8BRetrieval Strategy=Proposed2026.04 | 64.2 | |
| MAIN-RAG-Llama3 8BRetrieval Strategy=Training-free retrieval2026.04 | 64 | |
| MASS-RAG-Qwen3 8BRetrieval Strategy=Proposed2026.04 | 63.9 | |
| Qwen3 8BRetrieval Strategy=Training-free retrieval2026.04 | 62.1 | |
| Llama3 8BRetrieval Strategy=Training-free retrieval2026.04 | 61.8 | |
| MASS-RAG-Mistral 7BRetrieval Strategy=Proposed2026.04 | 60.9 | |
| MAIN-RAG-Mistral 7BRetrieval Strategy=Training-free retrieval2026.04 | 58.9 | |
| MASS-RAG-Llama2 7BRetrieval Strategy=Proposed2026.04 | 57.8 | |
| Mistral 7BRetrieval Strategy=Training-free retrieval2026.04 | 55.5 | |
| Self-RAG 7BRetrieval Strategy=Training-based retrieval2026.04 | 54.9 | |
| ZeroSearchBackbone=Qwen2.5-7B Instruct2026.05 | 51.5 | |
| Llama2 7BRetrieval Strategy=Training-free retrieval2026.04 | 50.9 | |
| AMATA 8BModel Scale=8B, Backbone Architecture=AMATA2026.05 | 49.62 | |
| ZeroSearchParameter Scale=7B, Search Environment=Google Web Search2025.11 | 48.8 | |
| MemSearcherParameter Scale=14B2025.11 | 48.8 | |
| Llama2-FT 7BRetrieval Strategy=Training-based retrieval2026.04 | 48.7 | |
| ReSearchParameter Scale=32B2025.11 | 48.2 | |
| Search-R1-baseParameter Scale=14B2025.11 | 48 | |
| MemSearcherParameter Scale=3B2025.11 | 47.9 | |
| MemSearcherParameter Scale=7B2025.11 | 47.8 | |
| SMART 8BModel Scale=8B, Backbone Architecture=SMART2026.05 | 47.66 | |
| EvolveRBackbone Model=Qwen2.5-7B2025.10 | 47.3 | |
| GiGPO 8BModel Scale=8B, Backbone Architecture=GiGPO2026.05 | 47.29 | |
| SLATEBackbone=Qwen2.5-7B-Base2026.02 | 47 | |
| SPA-RL 8BModel Scale=8B, Backbone Architecture=SPA-RL2026.05 | 46.85 | |
| Search-E1-InstructRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Process-supervision RL2026.05 | 46.1 | |
| SEARCH-R1Backbone=Qwen2.5-7B-Base2026.02 | 45.7 | |
| Llama2 13BRetrieval Strategy=Training-free retrieval2026.04 | 45.7 | |
| Search-R1-baseParameter Scale=7B2025.11 | 45.7 | |
| SLATEBackbone=Qwen2.5-3B-Base, Training Data=NQ+HotpotQA2026.02 | 45.1 | |
| AutoRefine-baseParameter Scale=3B2025.11 | 45 | |
| TIPSBackbone=Qwen2.5-7B Instruct2026.05 | 45 | |
| AutoRefine-BaseRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Outcome-reward RL2026.05 | 45 | |
| ZeroSearchParameter Scale=3B, Search Environment=Google Web Search2025.11 | 44.8 | |
| ZeroSearchBackbone=Qwen2.5-3B Instruct2026.05 | 44.8 | |
| AutoRefine-instructParameter Scale=3B2025.11 | 44.7 | |
| AutoRefine-InstructRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Outcome-reward RL2026.05 | 44.7 | |
| ReSearchParameter Scale=7B2025.11 | 44.6 | |
| Search-R1-instructParameter Scale=14B2025.11 | 44.2 | |
| PiCABackbone=Qwen2.5-7B Instruct2026.05 | 44.2 | |
| SelfRag 8BModel Scale=8B, Backbone Architecture=Self-RAG2026.05 | 43.55 | |
| SEARCH-R1Backbone=Qwen2.5-3B-Base, Training Data=NQ+HotpotQA2026.02 | 43.5 | |
| Search-R1-baseParameter Scale=3B2025.11 | 43.5 | |
| Search-R1-baseBackbone Model=Qwen2.5-3B2025.10 | 43.5 | |
| EvolveRBackbone Model=Qwen2.5-3B2025.10 | 43.4 | |
| ReSearch-BaseRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Outcome-reward RL2026.05 | 43 | |
| O2-SearcherParameter Scale=3B2025.11 | 42.9 | |
| TIPSBackbone=Qwen2.5-3B Instruct2026.05 | 42.8 | |
| GiGPO-InstructRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Process-supervision RL2026.05 | 42.4 | |
| PiCABackbone=Qwen2.5-3B Instruct2026.05 | 41.7 | |
| MT-PPOBackbone=Qwen2.5-7B Instruct2026.05 | 41.6 | |
| Search-R1-BaseRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Outcome-reward RL2026.05 | 41.3 | |
| RADIT 8BModel Scale=8B, Backbone Architecture=RADIT2026.05 | 41.15 | |
| R1-SearcherParameter Scale=7B, Search Environment=Google Web Search2025.11 | 41 | |
| MT-PPOBackbone=Qwen2.5-3B Instruct2026.05 | 40.5 | |
| DGPOModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 40.2 | |
| Search-R1-instructParameter Scale=7B2025.11 | 39.7 | |
| Search-R1-instructBackbone Model=Qwen2.5-7B2025.10 | 39.7 | |
| Search-R1Backbone=Qwen2.5-7B Instruct2026.05 | 39.7 | |
| ReSearch-InstructRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Outcome-reward RL2026.05 | 39.5 | |
| Teacher-3BModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B2025.08 | 39.3 | |
| RAGBackbone Model=Qwen2.5-7B2025.10 | 39.2 | |
| RAGBackbone=Qwen2.5-7B Instruct2026.05 | 39.2 | |
| Search-R1-InstructRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Outcome-reward RL2026.05 | 39.1 | |
| ZeroSearchBackbone=Qwen2.5-7B-Base2026.02 | 38.9 | |
| RAGBackbone Model=Qwen2.5-3B2025.10 | 38.7 | |
| RAGBackbone=Qwen2.5-3B Instruct2026.05 | 38.7 | |
| Naive RAGRetrieval Strategy=Single-Hop Retrieval2026.05 | 38.7 | |
| Rejection SamplingBackbone Model=Qwen2.5-7B2025.10 | 38 | |
| PPOModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 37.9 | |
| Search-R1-instructParameter Scale=3B2025.11 | 37.8 | |
| Search-R1-instructBackbone Model=Qwen2.5-3B2025.10 | 37.8 | |
| Search-R1Backbone=Qwen2.5-3B Instruct2026.05 | 37.8 | |
| KDModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 37.3 | |
| DistiLLMModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 37.3 | |
| ReSearchBackbone=Qwen2.5-7B-Base2026.02 | 37.2 | |
| ZeroSearchBackbone=Qwen2.5-3B-Base2026.02 | 36.5 | |
| TAIDModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 36.5 | |
| SeqKDModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 36.4 | |
| SFT → PPOModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 35.9 | |
| GKDModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 35.8 | |
| ReSearchBackbone=Qwen2.5-3B-Base2026.02 | 34.2 | |
| RAGBackbone=Qwen2.5-7B-Base2026.02 | 33.9 | |
| Rejection SamplingBackbone Model=Qwen2.5-3B2025.10 | 33.2 | |
| SFTBackbone=Qwen2.5-7B-Base2026.02 | 32.5 | |
| IRCoTBackbone=Qwen2.5-7B-Base2026.02 | 31.2 | |
| GPT4oBackbone Architecture=GPT-4o2026.05 | 30.94 | |
| IRCoTBackbone Model=Qwen2.5-7B2025.10 | 30.1 | |
| Search-o1Backbone=Qwen2.5-7B-Base2026.02 | 29.8 | |
| RAGBackbone=Qwen2.5-3B-Base2026.02 | 29.6 | |
| Llama3 8BRetrieval Strategy=Without retrieval2026.04 | 29.2 | |
| SFTBackbone=Qwen2.5-3B-Base2026.02 | 28.6 | |
| R1 (no search)Backbone=Qwen2.5-7B-Base2026.02 | 27.8 | |
| IRCoTBackbone=Qwen2.5-3B-Base2026.02 | 26.8 | |
| Mistral 7BRetrieval Strategy=Without retrieval2026.04 | 26.2 | |
| Search-o1Backbone Model=Qwen2.5-3B2025.10 | 26.2 | |
| Search-o1Backbone=Qwen2.5-3B Instruct2026.05 | 26.2 | |
| Search-o1Retrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Prompting2026.05 | 26.2 | |
| Search-o1Backbone=Qwen2.5-3B-Base2026.02 | 25.4 | |
| Qwen2.5-VL 3BText Source=Pure-Text, CEPE protocol=true2025.10 | 24.64 |