Knowledge-based Visual Question Answering on OKVQA
0.885AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oAgency Type (Agentic vs Non-Agentic)=Non-Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=GPT-4o2026.04 | 0.885 | |
| SPECTRAAgency Type (Agentic vs Non-Agentic)=Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=Qwen2.5-VL, Model Scale (Parameters)=7B, Framework=VERL2026.04 | 0.796 | |
| GPT-4o MiniAgency Type (Agentic vs Non-Agentic)=Non-Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=GPT-4o Mini2026.04 | 0.785 | |
| HF SmolAgentAgency Type (Agentic vs Non-Agentic)=Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=Qwen2.5-VL, Model Scale (Parameters)=7B, Framework=HF SmolAgent2026.04 | 0.76 | |
| VERLAgency Type (Agentic vs Non-Agentic)=Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=Qwen2.5-VL, Model Scale (Parameters)=7B, Framework=VERL2026.04 | 0.746 | |
| Gemma-3-ITAgency Type (Agentic vs Non-Agentic)=Non-Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=Gemma-3-IT, Model Scale (Parameters)=4B2026.04 | 0.74 | |
| CustomAgency Type (Agentic vs Non-Agentic)=Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=Gemma-3-IT, Model Scale (Parameters)=4B, Framework=Custom2026.04 | 0.74 | |
| Qwen2.5-VLAgency Type (Agentic vs Non-Agentic)=Non-Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=Qwen2.5-VL, Model Scale (Parameters)=7B2026.04 | 0.715 | |
| VERLAgency Type (Agentic vs Non-Agentic)=Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=Qwen2.5-VL, Model Scale (Parameters)=3B, Framework=VERL2026.04 | 0.705 | |
| SPECTRAAgency Type (Agentic vs Non-Agentic)=Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=Qwen2.5-VL, Model Scale (Parameters)=3B, Framework=VERL2026.04 | 0.665 | |
| PaLM-E(562B)Evaluation Protocol=finetuning2023.05 | 0.661 | |
| Phi-4-MultimodalAgency Type (Agentic vs Non-Agentic)=Non-Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=Phi-4-Multimodal, Model Scale (Parameters)=6B2026.04 | 0.65 | |
| Task ArithmeticUnsupervised=false2025.03 | 0.6387 | |
| DARE-LinearUnsupervised=false2025.03 | 0.6347 | |
| AdaMMSUnsupervised=true2025.03 | 0.6313 | |
| Ties-MergingUnsupervised=false2025.03 | 0.6292 | |
| MetaGPTUnsupervised=true2025.03 | 0.6288 | |
| InstructBLIPLLM Backbone=Vicuna-7B, Evaluation Protocol=finetuning2023.05 | 0.621 | |
| LLaVA-HR-XParam.=14B, Res.=1024, Data=1.2M, Inference Speed=12.9 t/s, Evaluation Protocol=In-domain2024.03 | 0.615 | |
| UNITBase LVLM=Llava-Next, Resolution Strategy=high-resolution grid slicing, Resolution=4482024.09 | 0.615 | |
| SigLIPBase LVLM=Llava-Next, Resolution Strategy=high-resolution grid slicing, Resolution=3842024.09 | 0.611 | |
| IdealToken=576, LLM Backbone=LLaMA 3.0 8B, Tuning Data=LLaVA SFT, Vision Encoder=Frozen2026.06 | 0.6106 | |
| LLaVA-OneVision 7B, DenseBackbone=LLaVA-OneVision 7B, Sparsity=Dense2026.03 | 0.61 | |
| mPLUG-Owl2(base)Method Category=Original Model2025.03 | 0.6098 | |
| LLaVA-HRParam.=13.4B, Res.=1024, Data=1.2M, Inference Speed=15.0 t/s, Evaluation Protocol=In-domain2024.03 | 0.607 | |
| Fuyu-8BParam.=8B, Res.=~600, Inference Speed=15.6 t/s, Evaluation Protocol=In-domain2024.03 | 0.606 | |
| DualPDBackbone=Qwen-2.5-VL-7B, Decoding Strategy=DualPD2026.01 | 0.6045 | |
| SETOKIMSize=7B, Visual Features=semantic-equivalent (SE), Visual Tokens=continuous (C), Observed during training=true2024.06 | 0.602 | |
| DoLABackbone=Qwen-2.5-VL-7B, Decoding Strategy=DoLA2026.01 | 0.602 | |
| LLaVA-NeXT 8B, DenseBackbone=LLaVA-NeXT 8B, Sparsity Pattern=Dense, Sparsity Type=N/A2026.03 | 0.6013 | |
| SigLIP2Token=576, LLM Backbone=LLaMA 3.0 8B, Tuning Data=LLaVA SFT, Vision Encoder=Frozen2026.06 | 0.5988 | |
| Qwen-2.5-VL-7BBackbone=Qwen-2.5-VL-7B, Decoding Strategy=Standard2026.01 | 0.5942 | |
| BLIP-2LLM Backbone=Vicuna-7B, Evaluation Protocol=finetuning2023.05 | 0.593 | |
| ToolTreeBackbone Model=GPT-4o2026.03 | 0.5927 | |
| LLaVA-HRParam.=7.4B, Res.=1024, Data=1.2M, Inference Speed=19.7 t/s, Evaluation Protocol=In-domain2024.03 | 0.589 | |
| DARE-TiesUnsupervised=false2025.03 | 0.5808 | |
| mPLUG-Owl2Param.=8.2B, Res.=448, Data=400M, Inference Speed=19.6 t/s, Evaluation Protocol=In-domain2024.03 | 0.577 | |
| CLIP-LBase LVLM=Llava-Next, Resolution Strategy=high-resolution grid slicing, Resolution=3362024.09 | 0.57 | |
| Qwen-VL-ChatParam.=9.6B, Res.=448, Data=1.4B, Inference Speed=17.0 t/s, Evaluation Protocol=In-domain2024.03 | 0.566 | |
| DualPDBackbone=LLaVA-1.6-13B, Decoding Strategy=DualPD2026.01 | 0.5574 | |
| InstructBLIPLLM Backbone=FlanT5-XXL, Evaluation Protocol=finetuning2023.05 | 0.555 | |
| ToolTreeBackbone Model=GPT-4o-mini2026.03 | 0.5538 | |
| DualPDBackbone=LLaVA-1.5-13B, Decoding Strategy=DualPD2026.01 | 0.5504 | |
| LLaVA-1.6-13BBackbone=LLaVA-1.6-13B, Decoding Strategy=Greedy2026.01 | 0.55 | |
| DoLABackbone=LLaVA-1.6-13B, Decoding Strategy=DoLA2026.01 | 0.5498 | |
| BLIP-2LLM Backbone=FlanT5-XXL, Evaluation Protocol=finetuning2023.05 | 0.547 | |
| CDBackbone=LLaVA-1.6-13B, Decoding Strategy=Contrastive Decoding2026.01 | 0.5467 | |
| LaVITSize=7B, Visual Features=patch-level features (P), Visual Tokens=continuous (C), Observed during training=false2024.06 | 0.546 | |
| DINOv2Token=576, LLM Backbone=LLaMA 3.0 8B, Tuning Data=LLaVA SFT, Vision Encoder=Frozen2026.06 | 0.5412 | |
| Few-ShotBackbone Model=GPT-4o2026.03 | 0.5362 | |
| DoLABackbone=LLaVA-1.5-13B, Decoding Strategy=DoLA2026.01 | 0.5352 | |
| LLaVAMethod Category=Original Model2025.03 | 0.5342 | |
| OctoToolsBackbone Model=GPT-4o2026.03 | 0.5342 | |
| DualPDBackbone=LLaVA-1.5-7B, Decoding Strategy=DualPD2026.01 | 0.532 | |
| DualPDBackbone=LLaVA-1.6-7B, Decoding Strategy=DualPD2026.01 | 0.53 | |
| DoLABackbone=LLaVA-1.6-7B, Decoding Strategy=DoLA2026.01 | 0.529 | |
| DualPDBackbone=Qwen-2-VL-7B, Decoding Strategy=DualPD2026.01 | 0.5274 | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5-13B, Decoding Strategy=Greedy2026.01 | 0.525 | |
| LLaVA-1.6-7BBackbone=LLaVA-1.6-7B, Decoding Strategy=Greedy2026.01 | 0.525 | |
| NEXT-GPTSize=7B, Visual Features=patch-level features (P), Visual Tokens=continuous (C), Observed during training=false2024.06 | 0.521 | |
| CDBackbone=LLaVA-1.6-7B, Decoding Strategy=Contrastive Decoding2026.01 | 0.521 | |
| DoLABackbone=LLaVA-1.5-7B, Decoding Strategy=DoLA2026.01 | 0.5192 | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B, Decoding Strategy=Greedy2026.01 | 0.516 | |
| CDBackbone=LLaVA-1.5-13B, Decoding Strategy=Contrastive Decoding2026.01 | 0.5021 | |
| OctoToolsBackbone Model=GPT-4o-mini2026.03 | 0.5017 | |
| HuggingGPTBackbone Model=GPT-4o2026.03 | 0.5012 | |
| DoLABackbone=Qwen-2-VL-7B, Decoding Strategy=DoLA2026.01 | 0.4936 | |
| Few-ShotBackbone Model=GPT-4o-mini2026.03 | 0.4846 | |
| Qwen-2-VL-7BBackbone=Qwen-2-VL-7B, Decoding Strategy=Standard2026.01 | 0.482 | |
| ATV-PruningBackbone=LLaVA-OneVision 7B, Sparsity=60% Sparsity2026.03 | 0.4615 | |
| BLIP-2Param.=14.2B, Res.=224, Data=129M, Evaluation Protocol=In-domain2024.03 | 0.459 | |
| IDEFICS-80BParam.=80B, Res.=224, Data=354M, Evaluation Protocol=In-domain2024.03 | 0.452 | |
| InstructBLIPParam.=14.2B, Res.=224, Data=130M, Evaluation Protocol=In-domain2024.03 | 0.448 | |
| SparseGPTBackbone=LLaVA-OneVision 7B, Sparsity=60% Sparsity2026.03 | 0.4465 | |
| Qwen2.5-VLAgency Type (Agentic vs Non-Agentic)=Non-Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=Qwen2.5-VL, Model Scale (Parameters)=3B2026.04 | 0.445 | |
| LLaVA-NeXT-7BNumber of Tokens=2880, Token Reduction Ratio=0%2026.06 | 0.4423 | |
| HuggingGPTBackbone Model=GPT-4o-mini2026.03 | 0.4419 | |
| EmuSize=7B, Visual Features=learnable queries (Q), Visual Tokens=continuous (C), Observed during training=false2024.06 | 0.434 | |
| PDropNumber of Tokens=320, Token Reduction Ratio=89%2026.06 | 0.4327 | |
| Qwen2.5-VL 7B, DenseBackbone=Qwen2.5-VL 7B, Sparsity=Dense2026.03 | 0.4222 | |
| ALVTSNumber of Tokens=320, Token Reduction Ratio=89%2026.06 | 0.417 | |
| DARTNumber of Tokens=320, Token Reduction Ratio=89%2026.06 | 0.4037 | |
| FastVNumber of Tokens=320, Token Reduction Ratio=89%2026.06 | 0.3891 | |
| IDEFICS-9BParam.=9B, Res.=224, Data=354M, Inference Speed=30.5 t/s, Evaluation Protocol=In-domain2024.03 | 0.384 | |
| TAMPBackbone=LLaVA-OneVision 7B, Sparsity=60% Sparsity2026.03 | 0.3765 | |
| ATV-PruningBackbone=LLaVA-NeXT 8B, Sparsity Pattern=4:8, Sparsity Type=Semi-Structured2026.03 | 0.2723 | |
| SparseGPTBackbone=Qwen2.5-VL 7B, Sparsity=60% Sparsity2026.03 | 0.2652 | |
| SparseGPTBackbone=LLaVA-NeXT 8B, Sparsity Pattern=4:8, Sparsity Type=Semi-Structured2026.03 | 0.2647 | |
| WandaBackbone=LLaVA-OneVision 7B, Sparsity=60% Sparsity2026.03 | 0.2528 | |
| CM3LeonSize=7B, Visual Features=patch-level features (P), Visual Tokens=discrete (D), Observed during training=false2024.06 | 0.238 | |
| ATV-PruningBackbone=Qwen2.5-VL 7B, Sparsity=60% Sparsity2026.03 | 0.2357 | |
| TAMPBackbone=Qwen2.5-VL 7B, Sparsity=60% Sparsity2026.03 | 0.2281 | |
| TAMPBackbone=LLaVA-NeXT 8B, Sparsity Pattern=4:8, Sparsity Type=Semi-Structured2026.03 | 0.2066 | |
| CustomAgency Type (Agentic vs Non-Agentic)=Agentic, Evaluation Protocol (Zero-shot)=Zero-shot, Backbone Architecture=Phi-4-Multimodal, Model Scale (Parameters)=6B, Framework=Custom2026.04 | 0.19 | |
| ATV-PruningBackbone=LLaVA-NeXT 8B, Sparsity Pattern=2:4, Sparsity Type=Semi-Structured2026.03 | 0.1791 | |
| SparseGPTBackbone=LLaVA-NeXT 8B, Sparsity Pattern=2:4, Sparsity Type=Semi-Structured2026.03 | 0.1679 | |
| WandaBackbone=LLaVA-NeXT 8B, Sparsity Pattern=4:8, Sparsity Type=Semi-Structured2026.03 | 0.166 | |
| WandaBackbone=Qwen2.5-VL 7B, Sparsity=60% Sparsity2026.03 | 0.158 | |
| TAMPBackbone=LLaVA-NeXT 8B, Sparsity Pattern=2:4, Sparsity Type=Semi-Structured2026.03 | 0.1384 | |
| WandaBackbone=LLaVA-NeXT 8B, Sparsity Pattern=2:4, Sparsity Type=Semi-Structured2026.03 | 0.1107 |