Visual Question Answering on OK-VQA (Accuracy)
84.7AccuracyVPD (55B)
Evaluation Results
| Method | Links | |
|---|---|---|
| VPD (55B)LLM=PaLI2024.02 | 84.7 | |
| CgRAGLLM/MLLM=InternVL3-8B2026.05 | 77.8 | |
| KU-RAGLLM/MLLM=GPT-4o2026.05 | 77.2 | |
| ProphetLLM=mPLUG2024.02 | 76.6 | |
| Hyper-ICLBackbone=LLaVA-OneVision (Qwen2-7B)2026.06 | 75.32 | |
| PromptcapLLM=GPT-32024.02 | 73.2 | |
| HiFICLBackbone=LLaVA-OneVision (Qwen2-7B)2026.03 | 73.12 | |
| Qwen2.5-VL-7BLLM/MLLM=-2026.05 | 72.4 | |
| MimICBackbone=LLaVA-OneVision (Qwen2-7B)2026.03 | 69.43 | |
| MimICBackbone=LLaVA-OneVision (Qwen2-7B)2026.06 | 69.43 | |
| DeepMMSearch-R1-7BKnowledge Source=Google Search Google Lens, Evaluation Protocol=LLM-as-Judge2025.08 | 67.8 | |
| HiFICLBackbone=LLaVA-v1.6 (Mistral-7B)2026.03 | 66.88 | |
| Single Task SoTA2023.12 | 66.8 | |
| 8-shot ICLBackbone=LLaVA-OneVision (Qwen2-7B)2026.03 | 66.59 | |
| 8-shot ICLBackbone=LLaVA-OneVision (Qwen2-7B)2026.06 | 66.59 | |
| Uni-MoE w/ MoE-Task4 (8E) + Aux lossModality=I,T,S,V, Training Task Strategy=MoE-Task4, Number of Experts=8, Auxiliary Balancing Loss=true2024.05 | 66.4 | |
| Uni-MoE w/ MoE-Task4 (8E)Modality=I,T,S,V, Training Task Strategy=MoE-Task4, Number of Experts=82024.05 | 66.2 | |
| Uni-MoE w/ MoE-Task4 (4E) + Aux lossModality=I,T,S,V, Training Task Strategy=MoE-Task4, Number of Experts=4, Auxiliary Balancing Loss=true2024.05 | 66.13 | |
| PALI-X-55Bmode=specialist2023.08 | 66.1 | |
| Uni-MoE w/ MoE-Task4 (4E)Modality=I,T,S,V, Training Task Strategy=MoE-Task4, Number of Experts=42024.05 | 66.02 | |
| PMSR (Qwen3-VL-8B)Knowledge Source=Wikipedia, Backbone=Qwen3-VL-8B, Evaluation Protocol=LLM-as-Judge2025.08 | 66 | |
| Emu2-Chattrained on task training set=true2023.12 | 64.8 | |
| CogVLM# Param=17B2024.08 | 64.8 | |
| MimICBackbone=LLaVA-v1.6 (Mistral-7B)2026.03 | 64.62 | |
| PaLI-X-VPDModel Scale=55B2023.12 | 64.6 | |
| PaLI-17B#Params=17B, Model Type=Specialist, Evaluation Protocol=Fine-tuned2023.11 | 64.5 | |
| PaLI-X-InstructModel Scale=55B2023.12 | 64.3 | |
| Raw dataMLLM=GPT-4V2026.03 | 63.6 | |
| Zero-shotBackbone=LLaVA-v1.6 (Mistral-7B)2026.03 | 63 | |
| Single-Modality-Expert-Task2Modality=I,T, Training Task Strategy=MoE-Task22024.05 | 62.91 | |
| AdaMMSunsupervised=true2025.03 | 62.11 | |
| MoE-LLaVA-2.7B×4-Top2Model Scale=2.7B, Number of Experts=4, Routing=Top22024.05 | 62.1 | |
| Uni-MoE w/ MoE-Task2 (4E)Modality=I,T,S,V, Training Task Strategy=MoE-Task2, Number of Experts=42024.05 | 62.1 | |
| LLaVA-1.5#Params=7.2B, Model Type=Generalist2023.11 | 62 | |
| Qwen-VL-7BShots=42024.06 | 62 | |
| Qwen-VL-7B + MTVProtocol=Multimodal Task Vectors2024.06 | 62 | |
| Qwen2.5-VL-3BLLM/MLLM=-2026.05 | 62 | |
| Uni-MoE w/ MoE-Task3 (4E)Modality=I,T,A,V, Training Task Strategy=MoE-Task3, Number of Experts=42024.05 | 61.96 | |
| LLaVA-1.5-13BModality=I,T, Model Scale=13B2024.05 | 61.93 | |
| Qwen-VL-7BShots=82024.06 | 61.5 | |
| InfMLLM-7BLLM=Vicuna-7B2023.11 | 61.33 | |
| DARE-Linearunsupervised=false2025.03 | 61.07 | |
| InstructBlip 7BPre-training sample size=129M, Instruction tuning sample size=1.2M, Trained on other VQA datasets=true2023.10 | 61 | |
| mPLUG-Owl2(base)2025.03 | 60.98 | |
| Task Arithmeticunsupervised=false2025.03 | 60.93 | |
| CogVLM2025.03 | 60.82 | |
| mPLUG-Owl3# Param=8B2024.08 | 60.1 | |
| MoE-LLaVA-1.6B×4-Top2Model Scale=1.6B, Number of Experts=4, Routing=Top22024.05 | 59.9 | |
| MMSearch-R1-7BKnowledge Source=Google Search Google Lens, Evaluation Protocol=LLM-as-Judge2025.08 | 59.9 | |
| augmented Tchebycheff objectiveMLLM=GPT-4V2026.03 | 59.2 | |
| CVLMLLM=Qwen-VL2024.02 | 58.91 | |
| CogVLMtrained on task training set=true2023.12 | 58.9 | |
| Qwen-VLzero-shot=true, backbone=Qwen-7B2023.08 | 58.6 | |
| QWen-VL-7BLLM=Qwen-7B2023.11 | 58.6 | |
| Qwen-VLModel Size=9.6B2023.12 | 58.6 | |
| Qwen-VLModel Scale=9.7B2023.12 | 58.6 | |
| Qwen-VL-7BShots=02024.06 | 58.6 | |
| Qwen-VL-7B‡Modality=I,T, Model Scale=7B2024.05 | 58.6 | |
| LLaVA-665KRecipe=LLaVA-665K2025.04 | 57.96 | |
| FlamingoModel Scale=80B, Zero-shot=true2023.12 | 57.8 | |
| Single-Modality-Expert-Task6Modality=I,T,S, Training Task Strategy=MoE-Task62024.05 | 57.77 | |
| mPLUG-Owl2#Params=8.2B, Model Type=Generalist2023.11 | 57.7 | |
| mPLUG-Owl2Model Size=8.2B2023.12 | 57.7 | |
| mPLUG-Owl2Model Scale=8.2B2023.12 | 57.7 | |
| mPLUG-Owl2# Param=8B2024.08 | 57.7 | |
| Uni-MoE w/ MoE-Task1 (4E)Modality=I,T,S, Training Task Strategy=MoE-Task1, Number of Experts=42024.05 | 57.63 | |
| PaLI-3-VPDModel Scale=5B2023.12 | 57.5 | |
| InstructBLIPLLM=Vicuna-7B2024.02 | 57.36 | |
| CVLM (3M IKPairs, Objects=3)LLM=Vicuna-7B, Objects=32024.02 | 57.17 | |
| Qwen-VLLLM=Qwen2024.02 | 57.13 | |
| CVLM (3M IKPairs, Objects=5)LLM=Vicuna-7B, Objects=52024.02 | 56.92 | |
| MiniGPT-v2-7BLLM=LLaMA2-7B2023.11 | 56.9 | |
| CVLM (3M IKPairs, Objects=1)LLM=Vicuna-7B, Objects=12024.02 | 56.9 | |
| Hyper-ICLBackbone=LLaVA-Interleave-7B2026.06 | 56.77 | |
| CVLM (3M IKPairs, Objects=8)LLM=Vicuna-7B, Objects=82024.02 | 56.71 | |
| PaLI-3-InstructModel Scale=5B2023.12 | 56.7 | |
| Qwen-VL-Chatzero-shot=true2023.08 | 56.6 | |
| Qwen-VL-Chat#Params=9.6B, Model Type=Generalist2023.11 | 56.6 | |
| Qwen-VL-ChatModel Scale=9.7B2023.12 | 56.6 | |
| Qwen-VL-13B-Chattrained on task training set=true2023.12 | 56.6 | |
| Qwen-VL-Chat# Param=9B2024.08 | 56.6 | |
| Surrogate model of SPActMLLM=GPT-4V2026.03 | 56.5 | |
| DownsampleMLLM=GPT-4V2026.03 | 56.2 | |
| Obf-WeakBlurMLLM=GPT-4V2026.03 | 56.1 | |
| Single-Modality-Expert-Task5Modality=I,T,S, Training Task Strategy=MoE-Task52024.05 | 56.01 | |
| 8-shot ICLBackbone=LLaVA-v1.6 (Mistral-7B)2026.03 | 56 | |
| SelectivePrivacyMLLM=GPT-4V2026.03 | 55.9 | |
| CVLM (3M IKPairs) w/o FKALLM=Vicuna-7B2024.02 | 55.7 | |
| Surrogate model of MPPARMLLM=GPT-4V2026.03 | 55.6 | |
| PaLM-E-12B#Params=12B, Model Type=Generalist2023.11 | 55.5 | |
| UIO-2XXLModel Size=6.8B2023.12 | 55.5 | |
| H-GIVRModel=Qwen2.5vl:7b, Prompt=Ours2026.02 | 55.43 | |
| Mantis-SigLIP# Param=8B2024.08 | 55.4 | |
| Surrogate model of VITAMLLM=GPT-4V2026.03 | 55.4 | |
| Obf-StrongBlurMLLM=GPT-4V2026.03 | 55.3 | |
| LLaVA-1.5-7BModality=I,T, Model Scale=7B2024.05 | 55.09 | |
| LLaVAPre-training sample size=558K, Instruction tuning sample size=158K2023.10 | 54.4 | |
| CVLMLLM=Vicuna-7B2024.02 | 54.3 | |
| Ties-Mergingunsupervised=false2025.03 | 54.15 | |
| Self-ConModel=Qwen2.5vl:7b, Prompt=Self-Con2026.02 | 54.1 |