Visual Question Answering on GQA (test-dev)
73.9AccuracyMDETR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MDETRAdd.=PT2026.06 | 73.9 | — | |
| CFR2021.10 | 72.1 | — | |
| CRFevaluation protocol=Supervised2023.03 | 72.1 | — | |
| Specialists SOTAsModel Category=Specialists2024.03 | 72.1 | — | |
| PaLI-X-55BModel Type=Specialist SOTA2023.10 | 72.1 | — | |
| HAN2021.10 | 69.5 | — | |
| DEALAdd.=-2026.06 | 69 | — | |
| LXMERTAdd.=PT2026.06 | 68.9 | — | |
| MMNAdd.=PR2026.06 | 67.8 | — | |
| PaLI-X-VPDScale=55B, Type=specialist2023.12 | 67.3 | — | |
| ViLTAdd.=PT2026.06 | 65.8 | — | |
| CogVLMScale=17B2023.12 | 65.2 | — | |
| TMN-TreeAdd.=PR2026.06 | 65.2 | — | |
| OSCAR+ w/ VinVLModel size=Base2021.01 | 65.05 | — | |
| VinVLVisual Encoder=VinVL-ResX152, V&L Pretrain Data=8.9M, V&L Pretrain Epoch=1162021.07 | 65.05 | — | |
| VinVLPre-training img data=VG, COCO, Objects365, SBU Flickr30k, CC, VQA, OpenImagesV5 (5.65M)2021.04 | 65.05 | — | |
| PaLI-X-VPDScale=55B, Type=generalist2023.12 | 64.9 | — | |
| Moxin-7BLLM backbone=Moxin-7B, Model Size=7B2025.12 | 64.88 | — | |
| PaLI-3-VPDScale=5B, Type=specialist2023.12 | 64.7 | — | |
| LLaVA-1.5-HDLLM=Vicuna-13B, Image Size=448^2, Pretrain Sample Size=558K, Finetune Sample Size=665K2023.10 | 64.7 | — | |
| SigLIP SO400M + TilingVision Encoder=SigLIP SO400M [52] + Tiling, Resolution=Up to 13 × 384², Compression=2 × 2 Unshuffle, Tokens/im=~ 19282024.12 | 64.5 | — | |
| RADIOv2.5-H + TilingVision Encoder=RADIOv2.5-H (ours) + Tiling, Resolution=Up to 7 × 768², Compression=ToMe r=2108, Tokens/im=~ 12332024.12 | 64.5 | — | |
| RADIOv2.5-HResolution=768², Tokens per image=512, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 64.5 | — | |
| MMICLMethod Category=E2E2023.12 | 64.4 | — | |
| RADIOv2.5-HResolution=768², Tokens per image=196, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 63.9 | — | |
| Cobra-8BLanguage-backbone scale=7–8B2026.05 | 63.9 | — | |
| RADIOv2.5-HVision Encoder=RADIOv2.5-H (ours), Resolution=768², Compression=ToMe r=2108, Tokens/im=1962024.12 | 63.8 | — | |
| LocVLM-LLLM=7B, Visual Scale=336, Zero-Shot=false2024.04 | 63.5 | — | |
| GIVL#Param=112M, Data=3.17M2023.01 | 63.44 | — | |
| LLaVA-1.5LLM=Vicuna-13B, PT=558K, IT=665K2024.03 | 63.3 | — | |
| LLaVA-1.5LLM=Vicuna-13B, Image Size=336^2, Pretrain Sample Size=558K, Finetune Sample Size=665K2023.10 | 63.3 | — | |
| Mistral v0.1 7BLLM backbone=Mistral, Model Size=7B, Variant=v0.12025.12 | 63.3 | — | |
| NMS2021.10 | 63.2 | — | |
| NSMevaluation protocol=Supervised2023.03 | 63 | — | |
| OpenAI-CLIPResolution=336², Tokens per image=144, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 63 | — | |
| SigLIP-SO400MResolution=384², Tokens per image=196, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 63 | — | |
| FullTraining Data Fraction=100%2026.05 | 63 | — | |
| MDETRBackbone=EfficientNet-B5, Pre-training img data=VG, COCO, Flickr30k (200k)2021.04 | 62.95 | — | |
| Dense ConnectorResolution=336, Tokens=144, PT+IT=0.5M+0.6M, LLM=Vicuna-7B2024.05 | 62.8 | — | |
| Mistral Instruct v0.1 7BLLM backbone=Mistral, Model Size=7B, Variant=Instruct v0.12025.12 | 62.71 | — | |
| RADIOv2.5-HVision Encoder=RADIOv2.5-H, LLM=Qwen2-7B-Instruct, SFT Data Mixture=9.8M samples, Tokens per image=5122024.12 | 62.7 | — | |
| VinVL*#Param=112M, Data=3.17M2023.01 | 62.58 | — | |
| MDETRBackbone=ResNet-101, Pre-training img data=VG, COCO, Flickr30k (200k)2021.04 | 62.48 | — | |
| MDETR2023.01 | 62.48 | — | |
| Llama-2 7BLLM backbone=Llama-2, Model Size=7B2025.12 | 62.44 | — | |
| SigLIP-SO400MVision Encoder=SigLIP-SO400M, LLM=Qwen2-7B-Instruct, SFT Data Mixture=9.8M samples, Tokens per image=5122024.12 | 62.4 | — | |
| Cobra-3.5BLanguage-backbone scale=2–4B2026.05 | 62.3 | — | |
| Llama-2 Chat 7BLLM backbone=Llama-2, Model Size=7B, Variant=Chat2025.12 | 62.11 | — | |
| SRLLM=not specified, Visual Scale=not specified, Zero-Shot=false2024.04 | 62.1 | — | |
| LLaVA-1.5LLM=Vicuna-7B, PT=558K, IT=665K2024.03 | 62 | — | |
| LLaVA-v1.5LLM=7B, Visual Scale=336, Zero-Shot=false2024.04 | 62 | — | |
| LLaVA-1.5LLM=Vicuna-7B, Image Size=336^2, Pretrain Sample Size=558K, Finetune Sample Size=665K2023.10 | 62 | — | |
| LLaVAResolution=336, Tokens=576, PT+IT=0.5M+0.6M, LLM=Vicuna-7B2024.05 | 62 | — | |
| TokenPackerResolution=336, Tokens=144, PT+IT=0.5M+0.6M, LLM=Vicuna-7B2024.05 | 61.9 | — | |
| LXMERT+CATT↑GPU Hours=1536 (1080Ti), 1056 (V100), Pre-training Data (Image / Text)=0.18M / 9.18M2021.03 | 61.87 | — | |
| OSCAR2021.10 | 61.6 | — | |
| OSCARModel Size=Large2020.04 | 61.58 | — | |
| OSCARModel Size=L2020.04 | 61.58 | — | |
| OSCARModel Size=Large2020.04 | 61.58 | — | |
| OSCARModel size=Base2021.01 | 61.58 | — | |
| OSCARPre-training img data=VG, COCO, Flickr, SBU (4.3M)2021.04 | 61.58 | — | |
| LLaVa v1.5 7B (Base)LLM backbone=LLaVa v1.5, Model Size=7B, Variant=Base2025.12 | 61.58 | — | |
| CLIP-ViLpVisual Encoder=CLIP-Res50x4, V&L Pretrain Data=9.2M, V&L Pretrain Epoch=202021.07 | 61.42 | — | |
| CLIP-ViL#Param=178M2023.01 | 61.34 | — | |
| PaLI-3-VPDScale=5B, Type=generalist2023.12 | 61.3 | — | |
| OSCARModel Size=Base2020.04 | 61.19 | — | |
| OSCARModel Size=B2020.04 | 61.19 | — | |
| OSCARModel Size=Base2020.04 | 61.19 | — | |
| OscarVisual Encoder=BUTD-Res101, V&L Pretrain Data=6.5M, V&L Pretrain Epoch=1182021.07 | 61.19 | — | |
| OscarData=4.1M2023.01 | 61.19 | — | |
| Partially⇑Architecture=CLIP-ViL2023.08 | 61.13 | — | |
| Ours‡Params. (M)=13.6, Mem. (G)=14.92026.04 | 60.91 | — | |
| LXMERT+CATTGPU Hours=960 (1080Ti), 624 (V100), Pre-training Data (Image / Text)=0.18M / 9.18M2021.03 | 60.84 | — | |
| MMN2020.04 | 60.83 | — | |
| MMN2020.04 | 60.83 | — | |
| Ours†Params. (M)=10.9, Mem. (G)=12.62026.04 | 60.78 | — | |
| ICONSTraining Data Fraction=20%2026.05 | 60.7 | — | |
| Ours_SAT->STPretraining Data=CC2019.12 | 60.65 | — | |
| Our SAT->STBackbone=BERTB, Training Strategy=All-Task Pretraining + Single-Task Finetuning, Number of Parameters=3B, Number of Models=12 x 250M2019.12 | 60.65 | — | |
| 12IN1GPU Hours=960 (V100), Pre-training Data (Image / Text)=5.40M / 7.48M2021.03 | 60.48 | — | |
| Ours♠Params. (M)=13.1, Mem. (G)=15.2, Time (ms)=59.892026.04 | 60.41 | — | |
| MMN2021.10 | 60.4 | — | |
| COIDOTraining Data Fraction=20%2026.05 | 60.4 | — | |
| MAGICTraining Data Fraction=20%2026.05 | 60.4 | — | |
| Mamba-VL-2.8BLanguage-backbone scale=2–4B2026.05 | 60.4 | — | |
| Fully-FTArchitecture=CLIP-ViL2023.08 | 60.25 | — | |
| Fully-FTParams. (M)=236.8, Mem. (G)=82.02026.04 | 60.25 | — | |
| Fully-FTParams. (M)=236.8, Mem. (G)=82.02026.04 | 60.25 | — | |
| Ours♡Params. (M)=10.4, Mem. (G)=12.2, Time (ms)=60.262026.04 | 60.21 | — | |
| AM-RADIO-HResolution=512², Tokens per image=256, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 60.2 | — | |
| Zamba2-VL-7BLanguage-backbone scale=7–8B2026.05 | 60.2 | — | |
| SHERLParams. (M)=13.0, Mem. (G)=14.0, Time (ms)=92.492026.04 | 60.16 | — | |
| SHERLParams. (M)=13.0, Mem. (G)=14.02026.04 | 60.16 | — | |
| Our SATBackbone=BERTB, Training Strategy=All-Task (AT), Number of Parameters=270M, Number of Models=1 x 270M2019.12 | 60.12 | — | |
| UniPTArchitecture=CLIP-ViL2023.08 | 60.1 | — | |
| UniPTParams. (M)=10.3, Mem. (G)=11.6, Time (ms)=106.382026.04 | 60.1 | — | |
| UniPTParams. (M)=10.3, Mem. (G)=11.62026.04 | 60.1 | — | |
| LXMERTPretraining Data=COCO + VG2019.12 | 60 | — | |
| SOTA [45]2019.12 | 60 | — | |
| LXMERT2020.04 | 60 | — |