Visual Question Answering on FVQA (test)
73.95AccuracyMAIL
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| MAILFusion Strategy=Modality-aware2024.02 | 73.95 | — | — | — | — | — | |
| MIAAgent Type=Memory-based Search Agent2026.04 | 69.6 | — | — | — | — | — | |
| HCNMNFusion Strategy=Modality-agnostic2024.02 | 69.43 | — | — | — | — | — | |
| Gemini-3-FlashAgent Type=Direct Answer2026.04 | 69.3 | — | — | — | — | — | |
| UnifERFusion Strategy=Modality-agnostic2024.02 | 66.83 | — | — | — | — | — | |
| DR-MMSearchAgentEvaluation Paradigm=Search Agent2026.04 | 66.8 | — | — | — | — | — | |
| DR-MMSearchAgentEvaluation Paradigm=Search Agent2026.04 | 66.8 | — | — | — | — | — | |
| MementoAgent Type=Memory-based Search Agent2026.04 | 66.3 | — | — | — | — | — | |
| Unsupervised MIAAgent Type=Memory-based Search Agent2026.04 | 65.1 | — | — | — | — | — | |
| ReasoningBankAgent Type=Memory-based Search Agent2026.04 | 64.7 | — | — | — | — | — | |
| MCAN2024.02 | 64.47 | — | — | — | — | — | |
| ExpeLAgent Type=Memory-based Search Agent2026.04 | 64.2 | — | — | — | — | — | |
| KI-NetFusion Strategy=Modality-agnostic2024.02 | 63.78 | — | — | — | — | — | |
| XNMFusion Strategy=Modality-agnostic2024.02 | 63.74 | — | — | — | — | — | |
| No MemoryAgent Type=Memory-based Search Agent2026.04 | 61.4 | — | — | — | — | — | |
| PMSRBackbone=Qwen2.5-VL-7B2025.08 | 61.2 | — | — | — | — | — | |
| Deepeyes2Agent Type=Search Agent2026.04 | 60.6 | — | — | — | — | — | |
| DeepEyesV2Backbone=Qwen2.5-VL-7B2025.08 | 60.6 | — | — | — | — | — | |
| Deepeyes2Evaluation Paradigm=Search Agent2026.04 | 60.6 | — | — | — | — | — | |
| RAGAgent Type=Memory-based Search Agent2026.04 | 60.5 | — | — | — | — | — | |
| MMSearch-R1Backbone=Qwen2.5-VL-7B2025.08 | 58.4 | — | — | — | — | — | |
| MMSearch-R1Evaluation Paradigm=Search Agent2026.04 | 58.4 | — | — | — | — | — | |
| MMSearch-R1Evaluation Paradigm=Search Agent2026.04 | 58.4 | — | — | — | — | — | |
| MMSearch-R1Agent Type=Search Agent2026.04 | 58 | — | — | — | — | — | |
| Mem0Agent Type=Memory-based Search Agent2026.04 | 55.6 | — | — | — | — | — | |
| Qwen2.5-VL-32B+ReACTAgent Type=Search Agent2026.04 | 51.3 | — | — | — | — | — | |
| Qwen2.5-VL-32BEvaluation Paradigm=Search Agent2026.04 | 51.3 | — | — | — | — | — | |
| Qwen2.5-VL-32BEvaluation Paradigm=Search Agent2026.04 | 51.3 | — | — | — | — | — | |
| GPT-5.4Agent Type=Direct Answer2026.04 | 50.8 | — | — | — | — | — | |
| GPT-4oAgent Type=Direct Answer2026.04 | 41.7 | — | — | — | — | — | |
| GPT-4oEvaluation Paradigm=Direct2026.04 | 41.7 | — | — | — | — | — | |
| A-MemAgent Type=Memory-based Search Agent2026.04 | 38.5 | — | — | — | — | — | |
| Gemini-2.5-ProAgent Type=Direct Answer2026.04 | 37.2 | — | — | — | — | — | |
| Gemini2.5 ProEvaluation Paradigm=Direct2026.04 | 37.2 | — | — | — | — | — | |
| Qwen2.5-VL-7B+ReACTAgent Type=Search Agent2026.04 | 34.2 | — | — | — | — | — | |
| Qwen2.5-VL-7BEvaluation Paradigm=Search Agent2026.04 | 34.2 | — | — | — | — | — | |
| Qwen2.5-VL-7BEvaluation Paradigm=Search Agent2026.04 | 34.2 | — | — | — | — | — | |
| MMSearch-R1Model Type=Trained Base Model2026.03 | 29.39 | — | — | — | 66.06 | 47.28 | |
| Qwen-VL-RAGWorkflow=RAG-based2026.03 | 24.83 | — | — | — | 100 | 100 | |
| Qwen2.5-VL-32BAgent Type=Direct Answer2026.04 | 24.7 | — | — | — | — | — | |
| Qwen2.5-VL-32BEvaluation Paradigm=Direct2026.04 | 24.7 | — | — | — | — | — | |
| Qwen2.5-VL-32BEvaluation Paradigm=Direct2026.04 | 24.7 | — | — | — | — | — | |
| TAMerging Strategy=Task Arithmetic2026.03 | 21.5 | — | — | — | 19.61 | 43.11 | |
| Qwen2.5-VL-7BAgent Type=Direct Answer2026.04 | 20.9 | — | — | — | — | — | |
| Qwen2.5-VL-7BEvaluation Paradigm=Direct2026.04 | 20.9 | — | — | — | — | — | |
| Qwen2.5-VL-7BEvaluation Paradigm=Direct2026.04 | 20.9 | — | — | — | — | — | |
| OBMMerging Strategy=Optimal Brain Merging2026.03 | 20.67 | — | — | — | 16.5 | 55.55 | |
| Qwen-VL-DAWorkflow=Direct Answering2026.03 | 15.94 | — | — | — | 0 | 0 | |
| Qwen-VL-R1Workflow=Search-augmented2026.03 | 15.61 | — | — | — | 8.44 | 25.5 | |
| TIESMerging Strategy=TIES-Merging2026.03 | 15 | — | — | — | 1.94 | 32.72 | |
| DAREMerging Strategy=DARE2026.03 | 10.06 | — | — | — | 8.39 | 29.94 | |
| Ensemble2016.06 | — | 58.76 | — | — | — | — | |
| FVQA modelQuestion-Query Mapping=gt-QQmaping (ground truth)2016.06 | — | 63.63 | 71.3 | 72.55 | — | — | |
| FVQA modelQuestion-Query Mapping=top-1-QQmaping2016.06 | — | 52.56 | 59.72 | 60.58 | — | — | |
| FVQA modelQuestion-Query Mapping=top-3-QQmaping2016.06 | — | 56.91 | 64.65 | 65.54 | — | — | |
| Hie-Question+ImageModel Architecture=Hie, Input Modal=Question + Image2016.06 | — | 33.7 | 50 | 64.08 | — | — | |
| Hie-Question+Image+Pre-VQAModel Architecture=Hie, Input Modal=Question + Image, Pre-training=VQA2016.06 | — | 43.14 | 59.44 | 72.2 | — | — | |
| Human2016.06 | — | 77.99 | — | — | — | — | |
| LSTM-ImageModel Architecture=LSTM, Input Modal=Image2016.06 | — | 20.55 | 36.01 | 55.74 | — | — | |
| LSTM-QuestionModel Architecture=LSTM, Input Modal=Question2016.06 | — | 10.45 | 19.02 | 31.64 | — | — | |
| LSTM-Question+ImageModel Architecture=LSTM, Input Modal=Question + Image2016.06 | — | 22.97 | 36.76 | 54.19 | — | — | |
| LSTM-Question+Image+Pre-VQAModel Architecture=LSTM, Input Modal=Question + Image, Pre-training=VQA2016.06 | — | 24.98 | 40.4 | 57.27 | — | — | |
| SVM-ImageModel Architecture=SVM, Input Modal=Image2016.06 | — | 18.41 | 32.42 | 47.53 | — | — | |
| SVM-QuestionModel Architecture=SVM, Input Modal=Question2016.06 | — | 10.37 | 20.72 | 34.63 | — | — | |
| SVM-Question+ImageModel Architecture=SVM, Input Modal=Question + Image2016.06 | — | 18.89 | 32.78 | 48.13 | — | — |