Open-domain Question Answering on MS-MARCO (test)
57.85AccuracyClean
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CleanLLM Backbone=GPT-4o, Pipeline=Chunking, Retrieval, and Reranking2026.06 | 57.85 | — | |
| PoisonedRAG-BBLLM Backbone=GPT-4o, Pipeline=Chunking, Retrieval, and Reranking2026.06 | 51.13 | 15.31 | |
| The RAG ParadoxLLM Backbone=GPT-4o, Pipeline=Chunking, Retrieval, and Reranking2026.06 | 47.75 | 15.7 | |
| Joint-GCGLLM Backbone=GPT-4o, Pipeline=Chunking, Retrieval, and Reranking2026.06 | 45.39 | 35.75 | |
| CRCPLLM Backbone=Qwen2.5-7B, Pipeline=Chunking, Retrieval, and Reranking2026.06 | 19.21 | 90.23 | |
| CRCPLLM Backbone=GPT-4o, Pipeline=Chunking, Retrieval, and Reranking2026.06 | 18.51 | 89.15 | |
| CRCPLLM Backbone=Vicuna-7B, Pipeline=Chunking, Retrieval, and Reranking2026.06 | 18.03 | 88.79 | |
| CRCPLLM Backbone=Qwen3-Max, Pipeline=Chunking, Retrieval, and Reranking2026.06 | 17.78 | 91.57 | |
| CRCPLLM Backbone=LLaMA-2-7B, Pipeline=Chunking, Retrieval, and Reranking2026.06 | 16.72 | 90.3 | |
| CRCPLLM Backbone=DeepSeek-R1, Pipeline=Chunking, Retrieval, and Reranking2026.06 | 16.34 | 90.7 |