Visual Question Answering on GQA
83.2AccuracyMetis-HOME
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Metis-HOMEBackbone=LLaVA-1.5-7B2026.04 | 83.2 | — | — | — | — | — | |
| CoGR-MoEBackbone=LLaVA-1.5-7B2026.04 | 83.2 | — | — | — | — | — | |
| GPT-5-miniGrounded=false2025.12 | 81.9 | — | — | — | — | — | |
| MoMEBackbone=LLaVA-1.5-7B2026.04 | 81.2 | — | — | — | — | — | |
| I2MoEBackbone=LLaVA-1.5-7B2026.04 | 81.1 | — | — | — | — | — | |
| GPT-5-miniGrounded=true2025.12 | 80.4 | — | — | — | — | — | |
| CL-MOEBackbone=LLaVA-1.5-7B2026.04 | 78.2 | — | — | — | — | — | |
| MH-MoEBackbone=LLaVA-1.5-7B2026.04 | 75.3 | — | — | — | — | — | |
| GRITBase Model=Qwen2.5-VL-3B2025.12 | 75 | — | — | — | — | — | |
| ToolTreeBackbone Model=GPT-4o2026.03 | 74.44 | — | — | — | — | — | |
| DualPDBackbone=LLaVA-1.6-7B, Decoding Strategy=DualPD2026.01 | 74 | — | — | — | — | — | |
| DoLABackbone=LLaVA-1.6-7B, Decoding Strategy=DoLA2026.01 | 73.4 | — | — | — | — | — | |
| AIMv2architecture=ViT-3B/14, #patches=576, resolution=336px2024.11 | 73.3 | — | — | — | — | — | |
| DualPDBackbone=LLaVA-1.6-13B, Decoding Strategy=DualPD2026.01 | 73.2 | — | — | — | — | — | |
| AIMv2architecture=ViT-1B/14, #patches=576, resolution=336px2024.11 | 73 | — | — | — | — | — | |
| AIMv2architecture=ViT-H/14, #patches=576, resolution=336px2024.11 | 72.8 | — | — | — | — | — | |
| DINOv2architecture=ViT-g/14, #patches=30342024.11 | 72.7 | — | — | — | — | — | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B2026.04 | 72.6 | — | — | — | — | — | |
| AIMv2architecture=ViT-L/14, #patches=576, resolution=336px2024.11 | 72.5 | — | — | — | — | — | |
| HAVCBackbone=LLaVA-1.5, Signal Type=grad+entropy2026.01 | 72.5 | — | — | — | — | — | |
| ViCropBackbone=LLaVA-1.5, Signal Type=rel-att2026.01 | 72.3 | — | — | — | — | — | |
| CDBackbone=LLaVA-1.6-13B, Decoding Strategy=Contrastive Decoding2026.01 | 72.2 | — | — | — | — | — | |
| CFRmode=specialist2023.08 | 72.1 | — | — | — | — | — | |
| CFRUtilizes ground truth scene graphs, programs and bounding boxes for auxiliary training=true2024.11 | 72.1 | — | — | — | — | — | |
| ViCropBackbone=LLaVA-1.5, Signal Type=grad-att2026.01 | 72.1 | — | — | — | — | — | |
| LLaVA-UHDVision Encoder=CLIP-L, Resolution=1008, LLM=Vicuna-13B, Data=1.2M2025.01 | 72 | — | — | — | — | — | |
| OpenAI CLIParchitecture=ViT-L/14, #patches=5762024.11 | 72 | — | — | — | — | — | |
| LLaVA-1.6-13BBackbone=LLaVA-1.6-13B, Decoding Strategy=Greedy2026.01 | 72 | — | — | — | — | — | |
| DoLABackbone=LLaVA-1.6-13B, Decoding Strategy=DoLA2026.01 | 71.9 | — | — | — | — | — | |
| DualPDBackbone=Qwen-2.5-VL-7B, Decoding Strategy=DualPD2026.01 | 71.86 | — | — | — | — | — | |
| CDBackbone=LLaVA-1.6-7B, Decoding Strategy=Contrastive Decoding2026.01 | 71.59 | — | — | — | — | — | |
| ToolTreeBackbone Model=GPT-4o-mini2026.03 | 71.54 | — | — | — | — | — | |
| VanillaBackbone=LLaVA-1.52026.01 | 71.4 | — | — | — | — | — | |
| DoLABackbone=Qwen-2.5-VL-7B, Decoding Strategy=DoLA2026.01 | 71.35 | — | — | — | — | — | |
| LLaVA-UHD v2Vision Encoder=CLIP-L, Resolution=1008, LLM=Vicuna-7B, Data=1.4M2025.01 | 71.3 | — | — | — | — | — | |
| ViCropBackbone=LLaVA-1.5, Signal Type=pure-att2026.01 | 71.3 | — | — | — | — | — | |
| PaliGemma2-3B + AuditDMResolution=448x448, Fine-tuning=per-task2025.12 | 71.1 | — | — | — | — | — | |
| SigLIParchitecture=ViT-So400M/14, #patches=7522024.11 | 71 | — | — | — | — | — | |
| Qwen-2.5-VL-7BBackbone=Qwen-2.5-VL-7B, Decoding Strategy=Standard2026.01 | 70.94 | — | — | — | — | — | |
| DualPDBackbone=LLaVA-1.5-13B, Decoding Strategy=DualPD2026.01 | 70.9 | — | — | — | — | — | |
| DualPDBackbone=LLaVA-1.5-7B, Decoding Strategy=DualPD2026.01 | 70.6 | — | — | — | — | — | |
| SigLIParchitecture=ViT-L/14, #patches=5762024.11 | 70.3 | — | — | — | — | — | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5-13B, Decoding Strategy=Greedy2026.01 | 70.2 | — | — | — | — | — | |
| DoLABackbone=LLaVA-1.5-13B, Decoding Strategy=DoLA2026.01 | 70.2 | — | — | — | — | — | |
| Show-oBackbone=Phi-1.5-1.3B, Resolution=256, Visual Input Type=Discrete2024.12 | 69.4 | — | — | — | — | — | |
| LLaVA-1.6-7BBackbone=LLaVA-1.6-7B, Decoding Strategy=Greedy2026.01 | 69.3 | — | — | — | — | — | |
| CDBackbone=LLaVA-1.5-13B, Decoding Strategy=Contrastive Decoding2026.01 | 69.1 | — | — | — | — | — | |
| OctoToolsBackbone Model=GPT-4o2026.03 | 68.58 | — | — | — | — | — | |
| DoLABackbone=LLaVA-1.5-7B, Decoding Strategy=DoLA2026.01 | 68.3 | — | — | — | — | — | |
| PaliGemma2-10BResolution=448x448, Fine-tuning=per-task2025.12 | 68.3 | — | — | — | — | — | |
| PaliGemma2-28BResolution=448x448, Fine-tuning=per-task2025.12 | 68.3 | — | — | — | — | — | |
| PaliGemma2-3BResolution=448x448, Fine-tuning=per-task2025.12 | 68.1 | — | — | — | — | — | |
| DualPDBackbone=Qwen-2-VL-7B, Decoding Strategy=DualPD2026.01 | 67.54 | — | — | — | — | — | |
| EUPE-ViT-BBackbone=ViT-B2026.03 | 67.3 | — | — | — | — | — | |
| Few-ShotBackbone Model=GPT-4o2026.03 | 66.84 | — | — | — | — | — | |
| Qwen-2-VL-7BBackbone=Qwen-2-VL-7B, Decoding Strategy=Standard2026.01 | 66.38 | — | — | — | — | — | |
| DeepStack-L-HDLLM=Vicuna-13B, Eff. Res.=1344, Vis. Tok.=14400, Cxt. Len.=2880, PT=558K, SFT=748K2024.06 | 66.2 | — | — | — | — | — | |
| DoLABackbone=Qwen-2-VL-7B, Decoding Strategy=DoLA2026.01 | 66.14 | — | — | — | — | — | |
| OctoToolsBackbone Model=GPT-4o-mini2026.03 | 66.14 | — | — | — | — | — | |
| ChameleonType=Und. and Gen., #Params=34B2024.08 | 66 | — | — | — | — | — | |
| FocusLLaVALLM=Llama3-8B2024.11 | 66 | — | — | — | — | — | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B, Decoding Strategy=Greedy2026.01 | 66 | — | — | — | — | — | |
| DINOv3-ViT-BBackbone=ViT-B2026.03 | 65.9 | — | — | — | — | — | |
| RADIOv2.5-BBackbone=ViT-B2026.03 | 65.8 | — | — | — | — | — | |
| OmniFusionLLM=GigaChat-7B, Encoder=CLIP VIT-large/14, Resolution=336, Zero-shot=true2024.04 | 65.72 | — | — | — | — | — | |
| LLaVA-NeXTLLM=Llama3-8B, implementation=ours2024.11 | 65.7 | — | — | — | — | — | |
| LLaVA-NeXT + MoVE-KD-v1.0LLM=Vicuna-13B, Model Scale=13B2025.01 | 65.7 | — | — | — | — | — | |
| SETOKIMSize=7B, Visual Features=semantic-equivalent (SE), Visual Tokens=continuous (C), Observed during training=true2024.06 | 65.6 | — | — | — | — | — | |
| PEcore-BBackbone=ViT-B2026.03 | 65.6 | — | — | — | — | — | |
| LLaVA-NextLLM=Vicuna-13B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=2880, PT=558K, SFT=765K2024.06 | 65.4 | — | — | — | — | — | |
| VT-LMMLLM=Mistral-7B, Res.=3362024.03 | 65.4 | — | — | — | — | — | |
| LongVILA-7B (S3)LLM=Qwen2-7B, Resolution=dynamic2024.08 | 65.4 | — | — | — | — | — | |
| LLaVA-NeXTLLM=Vicuna-13B, Model Scale=13B2025.01 | 65.4 | — | — | — | — | — | |
| LLaVA-NeXT-13BBase Model=LLaVA-NeXT-13B2026.06 | 65.4 | — | — | — | — | — | |
| LLaVA-Next 13BLLM=Vicuna-13B, Encoder=CLIP VIT-large/14, Resolution=672, Zero-shot=true2024.04 | 65.36 | — | — | — | — | — | |
| PIIP-LLaVAVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/336, LLM=Vicuna-13B, Data=65.22025.01 | 65.2 | — | — | — | — | — | |
| LLaVA-HR-XParam.=14B, Res.=1024, Data=1.2M, Inference Speed=12.9 t/s, Evaluation Protocol=In-domain2024.03 | 65.2 | — | — | — | — | — | |
| LLaVA-UHD#Data=1.2M, MaxRes.=672x1008, AR.=Any, TFLOPS=14.62024.03 | 65.2 | — | — | — | — | — | |
| DeepStack-L-HDLLM=Vicuna-7B, Eff. Res.=1344, Vis. Tok.=14400, Cxt. Len.=2880, PT=558K, SFT=748K2024.06 | 65.2 | — | — | — | — | — | |
| MoVALLM=Llama3-8B, Params=11B, Model Type=Specialist2024.04 | 65.2 | — | — | — | — | — | |
| LLaVA-NeXT-8BLLM=Llama 3-8B, Resolution=6722024.08 | 65.2 | — | — | — | — | — | |
| SigLIP2-BBackbone=ViT-B2026.03 | 65.2 | — | — | — | — | — | |
| HuggingGPTBackbone Model=GPT-4o-mini2026.03 | 65.13 | — | — | — | — | — | |
| SEA-PRIMELLM=Llama3-8B, Res.=3842024.08 | 65.1 | — | — | — | — | — | |
| InfMLLM-7B-ChatLLM=Vicuna-7B2023.11 | 65.1 | — | — | — | — | — | |
| Emu2-Chattrained on task training set=true2023.12 | 65.1 | — | — | — | — | — | |
| Emu2-ChatLLM=LLAMA-33B, Res.=4482024.03 | 65.1 | — | — | — | — | — | |
| SGPtoken ratio=64%2024.12 | 65.07 | — | — | — | — | 100.14 | |
| LLaMA-VIDLLM=Vicuna-13B, Res.=3362024.08 | 65 | — | — | — | — | — | |
| LLaMA-VIDLLM=Vicuna-13B, Resolution=3362023.11 | 65 | — | — | — | — | — | |
| mPLUG-Owl3# Param=8B2024.08 | 65 | — | — | — | — | — | |
| mPlug-Owl3LLM=Qwen-8B2024.11 | 65 | — | — | — | — | — | |
| PaLI-X-VPDModel Scale=55B2023.12 | 64.9 | — | — | — | — | — | |
| V-SkipBase Model=LLaVA-NeXT-13B, Hyperparameter (K/N)=N=242026.06 | 64.9 | — | — | — | — | — | |
| InternVL2-26Btoken ratio=100%2024.12 | 64.89 | — | — | — | — | 100 | |
| LLAVA-HRVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/448, LLM=Vicuna-13B, Data=1.2M2025.01 | 64.8 | — | — | — | — | — | |
| LLaVA-HRParam.=13.4B, Res.=1024, Data=1.2M, Inference Speed=15.0 t/s, Evaluation Protocol=In-domain2024.03 | 64.8 | — | — | — | — | — | |
| LLaVA-1.5+CoSLanguage=Vicuna-13B2024.03 | 64.8 | — | — | — | — | — | |
| LLaVA-HRParam.=13B, Speed=3.12024.10 | 64.8 | — | — | — | — | — | |
| γ-MoD-LLaVA-HRParam.=13B, Speed=4.82024.10 | 64.8 | — | — | — | — | — |