Visual Question Answering on POPE
89.6AccuracyInternVL3*
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL3*#Parameters=2B2026.03 | 89.6 | |
| VanillaSource=Qwen’25, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=0%2026.06 | 89.6 | |
| Qwen3-VL*#Parameters=2B2026.03 | 89.4 | |
| ARGUSVLM#Parameters=2B2026.03 | 89.3 | |
| ViCrop (Top-3)Model=Qwen2.5-VL-3B-Instruct, Evaluation protocol=zero-shot2025.12 | 88.5 | |
| Visual FunnelModel=Qwen2.5-VL-3B-Instruct, Evaluation protocol=zero-shot2025.12 | 88.5 | |
| ViCropModel=Qwen2.5-VL-3B-Instruct, Evaluation protocol=zero-shot2025.12 | 88.4 | |
| Visual FunnelModel=LLaVA-1.5-7B, Evaluation protocol=zero-shot2025.12 | 88.3 | |
| DeepSeekVL#Parameters=2B2026.03 | 88.3 | |
| GR3D-8BTraining Stage=Stage 12026.05 | 88.23 | |
| Qwen2.5-VL*#Parameters=3B2026.03 | 88.1 | |
| NVILA-Lite-8B2026.05 | 88.1 | |
| JanusFlowLLM Param=1.3B, Type=Unified2024.11 | 88 | |
| VanillaBackbone=QWEN-2.5-VL 7B, Average Tokens=100%2026.02 | 87.9 | |
| DiDi-Merging2026.05 | 87.83 | |
| VanillaSource=Qwen’25, Token Reduction=0%, Backbone=Qwen2.5-VL-7B2026.06 | 87.8 | |
| UIO-2XXLModel Size=6.8B2023.12 | 87.7 | |
| SmolVLM*#Parameters=2B2026.03 | 87.7 | |
| NuwaBackbone=QWEN-2.5-VL 7B, Average Tokens=75%2026.02 | 87.52 | |
| SmolVLMParameters=2B2025.12 | 87.5 | |
| ViCrop (Top-3)Model=LLaVA-1.5-7B, Evaluation protocol=zero-shot2025.12 | 87.5 | |
| NuwaBackbone=QWEN-2.5-VL 7B, Average Tokens=50%2026.02 | 87.46 | |
| ViCropModel=LLaVA-1.5-7B, Evaluation protocol=zero-shot2025.12 | 87.4 | |
| LLaVA-SGLLM=Vicuna-13B, #PT=558K, #IT=665K, Representation=E + T2024.03 | 87.3 | |
| ARGUSVLM#Parameters=256M2026.03 | 87.3 | |
| UIO-2XLModel Size=3.2B2023.12 | 87.2 | |
| PDrop+RerouteSource=Ours, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=66.7%2026.06 | 87.2 | |
| LLaVA-VTLLM=Vicuna-13B, #PT=558K, #IT=665K, Representation=E + T2024.03 | 87.1 | |
| Visual FunnelModel=InstructBLIP-7B, Evaluation protocol=zero-shot2025.12 | 87.1 | |
| Qwen2.5-VL-3B-InstructVisual input strategy=No Cropping, Evaluation protocol=zero-shot2025.12 | 87.1 | |
| NuwaBackbone=QWEN-2.5-VL 7B, Average Tokens=25%2026.02 | 87.06 | |
| JanusLLM Param=1.3B, Type=Unified2024.11 | 87 | |
| ViCrop (Top-3)Model=InstructBLIP-7B, Evaluation protocol=zero-shot2025.12 | 87 | |
| GR3D-8BTraining Stage=Stage 22026.05 | 87 | |
| LLaVA-DCapLLM=Vicuna-13B, #PT=558K, #IT=665K, Representation=E + T2024.03 | 86.9 | |
| FREE-Merging2026.05 | 86.73 | |
| ViCropModel=InstructBLIP-7B, Evaluation protocol=zero-shot2025.12 | 86.6 | |
| MMER2026.05 | 86.58 | |
| LLaVA-CapLLM=Vicuna-13B, #PT=558K, #IT=665K, Representation=E + T2024.03 | 86.4 | |
| LLaVA-1.5-13B-HD2025.12 | 86.3 | |
| ARGUSVLM#Parameters=500M2026.03 | 86.3 | |
| mPLUG-Owl2Model Size=8.2B2023.12 | 86.2 | |
| Individuals2026.05 | 86.17 | |
| LLaVa-1.5Model Size=7.2B2023.12 | 85.9 | |
| LLaVa-1.5Model Size=13B2023.12 | 85.9 | |
| LLaVA-1.5 (V-7B)LLM=Vicuna-7B, #PT=558K, #IT=665K, Representation=Visual Embeddings (E)2024.03 | 85.9 | |
| LLaVA-1.5 (V-13B)LLM=Vicuna-13B, #PT=558K, #IT=665K, Representation=Visual Embeddings (E)2024.03 | 85.9 | |
| LLaVA-v1.5LLM Param=7B, Type=Und. Only2024.11 | 85.9 | |
| LLaVA-1.5Parameters=7B2025.12 | 85.9 | |
| SmolVLM*#Parameters=500M2026.03 | 85.9 | |
| EUPE-ViT-BBackbone=ViT-B2026.03 | 85.9 | |
| FerretModel Size=7.2B2023.12 | 85.8 | |
| VILA-ULLM Param=7B, Type=Unified2024.11 | 85.8 | |
| HAVCBackbone=LLaVA-1.5, Signal Type=grad+entropy2026.01 | 85.8 | |
| SmolVLMParameters=500M2025.12 | 85.8 | |
| PEcore-BBackbone=ViT-B2026.03 | 85.8 | |
| PDrop+RerouteSource=Ours, Token Reduction=66.7%, Backbone=Qwen2.5-VL-7B2026.06 | 85.8 | |
| VL-JEPASFTParameters=1.6B2025.12 | 85.7 | |
| DINOv3-ViT-BBackbone=ViT-B2026.03 | 85.7 | |
| LLaVA-1.5-7BVisual input strategy=No Cropping, Evaluation protocol=zero-shot2025.12 | 85.6 | |
| MRoPEPositional Encoding Method=MRoPE, DIPE Enhancement=+DIPE2026.03 | 85.58 | |
| PDropSource=CVPR’25, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=66.7%2026.06 | 85.5 | |
| BLIP-2LLM=Vicuna-13B, #PT=129M, Representation=Visual Embeddings (E)2024.03 | 85.3 | |
| Emu3-ChatLLM Param=8B, Type=Und. Only2024.11 | 85.2 | |
| FastV+RerouteSource=Ours, Token Reduction=66.7%, Backbone=Qwen2.5-VL-7B2026.06 | 85.2 | |
| LLAVA-PhiLLM Param=2.7B, Type=Und. Only2024.11 | 85 | |
| SigLIP2-BBackbone=ViT-B2026.03 | 85 | |
| MobileVLMLLM Param=2.7B, Type=Und. Only2024.11 | 84.9 | |
| ViCropBackbone=LLaVA-1.5, Signal Type=grad-att2026.01 | 84.9 | |
| ShikraModel Size=7.2B2023.12 | 84.7 | |
| MobileVLM-V2LLM Param=2.7B, Type=Und. Only2024.11 | 84.7 | |
| ViCropBackbone=LLaVA-1.5, Signal Type=rel-att2026.01 | 84.7 | |
| InstructBLIP-7BVisual input strategy=No Cropping, Evaluation protocol=zero-shot2025.12 | 84.7 | |
| RADIOv2.5-BBackbone=ViT-B2026.03 | 84.7 | |
| PDropSource=CVPR’25, Token Reduction=66.7%, Backbone=Qwen2.5-VL-7B2026.06 | 84.7 | |
| FastV+RerouteSource=Ours, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=66.7%2026.06 | 84.7 | |
| FastVSource=ECCV’24, Token Reduction=66.7%, Backbone=Qwen2.5-VL-7B2026.06 | 84.6 | |
| MobileVLMLLM Param=1.4B, Type=Und. Only2024.11 | 84.5 | |
| MobileVLM#Parameters=1.7B2026.03 | 84.5 | |
| DUNE-BBackbone=ViT-B2026.03 | 84.5 | |
| PEspatial-BBackbone=ViT-B2026.03 | 84.4 | |
| MobileVLM-V2LLM Param=1.4B, Type=Und. Only2024.11 | 84.3 | |
| MobileVLM-V2#Parameters=1.7B2026.03 | 84.3 | |
| LLaVA-v1.5-Phi-1.5LLM Param=1.3B, Type=Und. Only2024.11 | 84.1 | |
| ViCropBackbone=LLaVA-1.5, Signal Type=pure-att2026.01 | 84 | |
| VanillaBackbone=LLaVA-1.52026.01 | 83.9 | |
| MiniGemini#Parameters=2.3B2026.03 | 83.9 | |
| PDrop+RerouteSource=Ours, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=77.8%2026.06 | 83.9 | |
| MRoPE-IPositional Encoding Method=MRoPE-I, DIPE Enhancement=+DIPE2026.03 | 83.72 | |
| Vicuna-DCapLLM=Vicuna-13B, #IT=665K, Representation=Text (T)2024.03 | 83.4 | |
| Video-LLaVAParameters=7B2025.12 | 83.4 | |
| PDrop+RerouteSource=Ours, Token Reduction=77.8%, Backbone=Qwen2.5-VL-7B2026.06 | 83.1 | |
| ViCropBackbone=InstructBLIP, Signal Type=pure-grad2026.01 | 82.9 | |
| HAVCBackbone=InstructBLIP, Signal Type=grad+entropy2026.01 | 82.7 | |
| FastV+RerouteSource=Ours, Backbone=Qwen3.5-9B-Hybrid, Average Gated Attention Token Reduction=77.8%2026.06 | 82.5 | |
| ViCropBackbone=InstructBLIP, Signal Type=rel-att2026.01 | 82.4 | |
| Vicuna-SGLLM=Vicuna-13B, #IT=665K, Representation=Text (T)2024.03 | 82.3 | |
| ViCropBackbone=InstructBLIP, Signal Type=grad-att2026.01 | 82 | |
| Vicuna-VTLLM=Vicuna-13B, #IT=665K, Representation=Text (T)2024.03 | 81.9 | |
| VanillaBackbone=InstructBLIP2026.01 | 81.4 |