Knowledge-Based Visual Question Answering on E-VQA All
45.8AccuracyDBAgent (SFT: E-VQA)
Evaluation Results
| Method | Links | |
|---|---|---|
| DBAgent (SFT: E-VQA)LLM=Qwen2.5-VL-7B, Retriever=EVA-CLIP-8B + bge-m32026.04 | 45.8 | |
| DBAgent (SFT: Mixed)LLM=Qwen2.5-VL-7B, Retriever=EVA-CLIP-8B + bge-m32026.04 | 45.2 | |
| DBAgent (SFT: InfoSeek)LLM=Qwen2.5-VL-7B, Retriever=EVA-CLIP-8B + bge-m32026.04 | 44.3 | |
| VLM-PRFLLM=InternVL3-8B, Retriever=EVA-CLIP-8B2026.04 | 39.2 | |
| ReflectiVALLM=Qwen2.5-VL-7B, Retriever=EVA-CLIP-8B2026.04 | 36.8 | |
| VLM-PRFLLM=Qwen2.5-VL-7B, Retriever=EVA-CLIP-8B2026.04 | 36 | |
| ReflectVALLM=LLaMA-3.1-8B, Retriever=EVA-CLIP-8B2026.04 | 29.2 | |
| GPT-4VLLM=GPT-4V, Retriever=–2026.04 | 28.1 | |
| DBAgent (w/o SFT)LLM=Qwen2.5-VL-7B, Retriever=EVA-CLIP-8B + bge-m32026.04 | 23.9 | |
| Qwen2.5-VL-7B (Base)LLM=Qwen2.5-VL-7B (Base), Retriever=–2026.04 | 20.3 | |
| RORA-VLMLLM=LLaVA-v1.5-7B, Retriever=CLIP ViT-L/142026.04 | 20.3 | |
| Wiki-LLaVALLM=LLaVA-v1.5-7B, Retriever=CLIP ViT-L/14 + Contriever2026.04 | 20.3 | |
| LLaVA-v1.5LLM=Vicuna-7B, Retriever=–2026.04 | 16.9 | |
| BLIP-2LLM=Flan-T5XL, Retriever=–2026.04 | 12.4 | |
| InstructBLIPLLM=Flan-T5XL, Retriever=–2026.04 | 12 |