Visual Question Answering on InfoSeek (val)
47.2Overall AccuracyReAG
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ReAGGenerator=Qwen2.5-VL-7B, Retriever=EVA-CLIP-8B2025.11 | 47.2 | 48.3 | 46.2 | |
| ReflectiVAGenerator=Qwen2.5-VL-7B, Retriever=EVA-CLIP-8B2025.11 | 43.9 | 43.5 | 44.3 | |
| OMGMRetriever=EVA-CLIP-8B, Model=LLaVA-1.5-7B, Reranking=true2025.08 | 43.5 | — | — | |
| OMGMGenerator Model=LLaVA-1.5-7B, Gen. FT=false, Ret. FT=true2025.05 | 43.49 | 43.46 | 43.53 | |
| ReAGGenerator=Qwen2.5-VL-3B, Retriever=EVA-CLIP-8B2025.11 | 43.3 | 43.7 | 42.9 | |
| VLM-PRFGenerator=Qwen2.5-VL-7B, Retriever=EVA-CLIP-8B2025.11 | 42.8 | 43.3 | 42.7 | |
| VLM-PRFGenerator=InternVL3-8B, Retriever=EVA-CLIP-8B2025.11 | 42.5 | 43.5 | 42.1 | |
| Wiki-PRF(w/ RL)Retriever=EVA-CLIP-8B, Model=VLM-PRF-7B2025.08 | 42.5 | — | — | |
| OMGMRetriever=EVA-CLIP-8B, Model=GPT-4o, Reranking=true2025.08 | 42.1 | — | — | |
| VLM-PRFGenerator=LLaVA-MORE-8B, Retriever=EVA-CLIP-8B2025.11 | 40.8 | 41.3 | 40.6 | |
| mKG-RAGGenerator=LLaVA-MORE-8B, Retriever=Custom VLM2025.11 | 40.5 | 41.4 | 39.6 | |
| mR2AGGenerator Model=LLaVA-1.5-7B, Gen. FT=true, Ret. FT=true2025.05 | 40.2 | 40.6 | 39.8 | |
| mR2AGGenerator=LLaVA-v1.5-7B, Retriever=CLIP ViT-L/142025.11 | 40.2 | 40.6 | 39.8 | |
| mR²AGRetriever=CLIP-ViT-L, Model=LLaVA-1.5-7B, Reranking=true2025.08 | 40.2 | — | — | |
| ReflectiVAGenerator Model=LLAVA-MORE-8B, Gen. FT=true, Ret. FT=true2025.05 | 40.1 | 40.4 | 39.8 | |
| ReflectiVAGenerator=LLaVA-MORE-8B, Retriever=EVA-CLIP-8B2025.11 | 40.1 | 40.4 | 39.8 | |
| ReflectiVARetriever=EVA-CLIP-8B, Model=LLaVA-MORE-8B2025.08 | 40.1 | — | — | |
| VLM-PRFGenerator=Qwen2.5-VL-3B, Retriever=EVA-CLIP-8B2025.11 | 39 | 39.7 | 38.8 | |
| ReflectiVAGenerator=Qwen2.5-VL-3B, Retriever=EVA-CLIP-8B2025.11 | 38.9 | 39.6 | 38.1 | |
| MMKB-RAGRetriever=PreFLMR ViT-G, Model=Qwen2-VL-7B, Reranking=true2025.08 | 36.7 | — | — | |
| OMGMGenerator Model=InternVL-2.5-8B, Gen. FT=false, Ret. FT=true2025.05 | 36.1 | 37.16 | 35.1 | |
| OMGMGenerator Model=LLaMA3-8B, Gen. FT=false, Ret. FT=true2025.05 | 34.42 | 35.26 | 33.61 | |
| EchoSightGenerator Model=Mistral-7B | LLaMA3-8B, Gen. FT=false, Ret. FT=true2025.05 | 31.3 | — | — | |
| EchoSightGenerator=Mistral-7B/LLaMA-3-8B, Retriever=EVA-CLIP-8B2025.11 | 31.3 | — | — | |
| EchoSightRetriever=EVA-CLIP-8B, Model=Mistral-7B, Reranking=true2025.08 | 31.3 | — | — | |
| EchoSightGenerator=LLaMA-3.1-8B, Retriever=EVA-CLIP-8B2025.11 | 30.4 | 30 | 30.7 | |
| Wiki-LLaVAGenerator Model=LLaVA-1.5-7B, Gen. FT=false, Ret. FT=true2025.05 | 28.9 | 30.1 | 27.8 | |
| Wiki-LLaVAGenerator=LLaVA-v1.5-7B, Retriever=CLIP ViT-L/14+Contriever2025.11 | 28.9 | 30.1 | 27.8 | |
| Wiki-LLaVARetriever=CLIP-ViT-L, Model=LLaVA-1.5-7B2025.08 | 28.9 | — | — | |
| Qwen2.5-VL-7B2025.11 | 23.7 | 22.8 | 24.1 | |
| LLM-RAGenerator Model=BLIP2-Flan-T5XL, Gen. FT=true, Ret. FT=true2025.05 | 23.14 | 26.12 | 20.9 | |
| LLM-RARetriever=EVA-CLIP-8B, Model=BLIP2-Flan-T5XL2025.08 | 23.1 | — | — | |
| RET-2Retriever=RET-2, Model=LLaVA-MORE-8B2025.08 | 22.8 | — | — | |
| UniRVQABase Models=InstructBLIP, Evaluation Protocol=Fine-tuned with knowledge, K=52025.04 | 22.06 | 24.01 | 20.4 | |
| CLIP + FiDEvaluation Protocol=Fine-tuned with knowledge2025.04 | 20.9 | 23.3 | 19.1 | |
| CLIP + PaLMBase Models=PaLM(540B), Evaluation Protocol=Fine-tuned with knowledge2025.04 | 20.4 | 22.7 | 18.5 | |
| PALI-17BBase Models=PALI, Evaluation Protocol=Standard fine-tuned on the dataset2025.04 | 19.7 | 24.2 | 16.7 | |
| Qwen2.5-VL-3B2025.11 | 18.3 | 18.9 | 17.7 | |
| InstructBLIP-T5XLBase Models=InstructBLIP, Evaluation Protocol=Standard fine-tuned on the dataset2025.04 | 14.5 | 15 | 14 | |
| BLIP-22025.11 | 12.5 | 12.7 | 12.3 | |
| BLIP2-T5XLBase Models=BLIP2, Evaluation Protocol=Standard fine-tuned on the dataset2025.04 | 12.5 | 12.7 | 12.3 | |
| DPRV+TGenerator=Multi-passage BERT, Retriever=CLIP ViT-B/322025.11 | 12.4 | — | — | |
| LLaVA-v1.5-7B2025.11 | 9.5 | 9.6 | 9.4 | |
| LLaVA-MORE-8B2025.11 | 7.8 | 8.3 | 8.9 | |
| PaLM(Q-only)Base Models=PaLM, Evaluation Protocol=Standard fine-tuned on the dataset2025.04 | 4.8 | 5.5 | 4.2 | |
| CoMEMGenerator=Qwen2.5-VL-7B, Retriever=Custom VLM2025.11 | — | 32.8 | 28.5 | |
| RORA-VLMGenerator Model=LLaVA-1.5-7B, Gen. FT=false, Ret. FT=true2025.05 | — | 27.34 | 25.1 | |
| RORA-VLMGenerator=LLaVA-v1.5-7B, Retriever=CLIP ViT-L/142025.11 | — | 25.1 | 27.3 |