Visual Grounding on RefCOCO (val)
95.2AccuracyVanilla
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VanillaBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=100%2026.02 | 95.2 | — | — | |
| Phi3V-dist#PT=0, #FT=127K2025.03 | 94.8 | — | — | |
| IVC-PruneBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=52%2026.02 | 94.5 | — | — | |
| Phi3V-vocab#PT=0, #FT=127K2025.03 | 94.5 | — | — | |
| Phi3V-sft#PT=0, #FT=127K2025.03 | 94.3 | — | — | |
| Qwen3-VL-8B-Thinking + EGMBackbone=Qwen3-VL-8B, Variant=Thinking, Enhancement=EGM2026.01 | 93.9 | — | — | |
| InternVL2.5Number of Parameters=78B2025.02 | 93.7 | — | — | |
| W-FastVBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=54%2026.02 | 93.6 | — | — | |
| Youtu-VLModel Category=General-Purpose VLM, Model Parameters=4B, Instruct Version=true, Task-specific fine-tuning=false2026.01 | 93.6 | — | — | |
| Youtu-VLModel Size=4B2026.01 | 93.6 | — | — | |
| InternVL-3-8B + EGMBackbone=InternVL-3-8B, Enhancement=EGM2026.01 | 93.6 | — | — | |
| Qwen3-VL-4B-Thinking + EGMBackbone=Qwen3-VL-4B, Variant=Thinking, Enhancement=EGM2026.01 | 93.5 | — | — | |
| Florence-2Backbone=DaViT-B2026.01 | 93.4 | — | — | |
| InternVL-3-78BBackbone=InternVL-3-78B2026.01 | 93.4 | — | — | |
| OpenVLThinkerV22026.04 | 93.4 | — | — | |
| Florence-2-L#PT=126M, #FT=127K2025.03 | 93.4 | — | — | |
| UFOBackbone=InternVL2.5-8B2026.01 | 93.1 | — | — | |
| PDropBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=57%2026.02 | 93 | — | — | |
| Qwen3-VL-2B-Thinking + EGMBackbone=Qwen3-VL-2B, Variant=Thinking, Enhancement=EGM2026.01 | 93 | — | — | |
| Qwen3-VL-235B-A22B-InstructBackbone=Qwen3-VL-235B-A22B, Variant=Instruct2026.01 | 92.9 | — | — | |
| Qwen3-VL-235B-A22B-ThinkingBackbone=Qwen3-VL-235B-A22B, Variant=Thinking2026.01 | 92.9 | — | — | |
| Ferretv2#PT=1.1M, #FT=127K2025.03 | 92.8 | — | — | |
| CogVLM-Grounding-17BModel Size=17B, Zero-shot=false2024.02 | 92.76 | — | — | |
| Qwen2.5-VLNumber of Parameters=72B2025.02 | 92.7 | — | — | |
| UNINEXTModel Category=Specialist2024.03 | 92.64 | — | — | |
| FastVBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=54%2026.02 | 92.6 | — | — | |
| Classic Specialist (VLM)Model Category=Classic Specialist, Task-specific fine-tuning=true, Task-specific decoders (*)=true2026.01 | 92.6 | — | — | |
| UNINEXT#PT=600K, #FT=127K2025.03 | 92.6 | — | — | |
| Florence-2-B#PT=126M, #FT=127K2025.03 | 92.6 | — | — | |
| ONE-PEACE2023.05 | 92.58 | — | — | |
| InternVL-3.5Model Category=General-Purpose VLM, Model Parameters=4B, Instruct Version=false, Task-specific fine-tuning=false2026.01 | 92.5 | — | — | |
| InternVL-3.5Model Size=4B2026.01 | 92.5 | — | — | |
| InternVL-3-8BBackbone=InternVL-3-8B2026.01 | 92.5 | — | — | |
| InternVL3-8BModel Size=8B2026.02 | 92.5 | — | — | |
| InternVL-3.5Model Size=4B2026.05 | 92.5 | — | — | |
| Qwen3-VL-SegModel Size=4B, Training Stage=S-22026.05 | 92.3 | — | — | |
| InternVL-3-2B + EGMBackbone=InternVL-3-2B, Enhancement=EGM2026.01 | 92.2 | — | — | |
| Qwen3-VLvariant=GDPO2026.04 | 92.2 | — | — | |
| Qwen3-VLvariant=GRPO2026.04 | 92.1 | — | — | |
| OFA2023.05 | 92.04 | — | — | |
| OneThinker-8B2026.04 | 92 | — | — | |
| UFOModel Category=Vision-Centric VLM, Model Parameters=8B, Extra task-specific tokens (†)=true, Task-specific fine-tuning=false2026.01 | 91.8 | — | — | |
| Qwen3-VLModel Size=4B, Training Stage=S-12026.05 | 91.8 | — | — | |
| Qwen3-VL-8B-InstructBackbone=Qwen3-VL-8B, Variant=Instruct2026.01 | 91.6 | — | — | |
| Qwen2.5-VL-7B AIFAIF=true2026.04 | 91.6 | — | — | |
| Qwen3-VLModel Size=4B, Training Stage=instruct2026.05 | 91.6 | — | — | |
| RoboInter-Qwen-7BModel Size=7B, Backbone=Qwen2026.02 | 91.5 | — | — | |
| RoboInter-LLaVAOV-7BModel Size=7B, Backbone=LLaVA-OV2026.02 | 91.3 | — | — | |
| Qwen3-VL-4B-InstructBackbone=Qwen3-VL-4B, Variant=Instruct2026.01 | 91 | — | — | |
| Qwen3-VL-8B-ThinkingBackbone=Qwen3-VL-8B, Variant=Thinking2026.01 | 91 | — | — | |
| Qwen3-VLModel Category=General-Purpose VLM, Model Parameters=4B, Instruct Version=true, Task-specific fine-tuning=false2026.01 | 90.7 | — | — | |
| Qwen3-VLModel Size=4B2026.01 | 90.7 | — | — | |
| FIBER2023.05 | 90.68 | — | — | |
| Grounding DINO2025.02 | 90.6 | — | — | |
| Grounding DINOBackbone=Swin-L2026.01 | 90.6 | — | — | |
| Grounding DINO2026.04 | 90.6 | — | — | |
| Grounding-DINO-L2026.04 | 90.6 | — | — | |
| Grounding-DINO2023.05 | 90.56 | — | — | |
| G-DINO-LModel Category=Specialist2024.03 | 90.56 | — | — | |
| Classic Specialist (Non-VLM)Model Category=Classic Specialist, Task-specific fine-tuning=true2026.01 | 90.5 | — | — | |
| VLM-R12026.04 | 90.5 | — | — | |
| VanillaBackbone Model=InternVL 2.5 8B, Average Tokens=100%2026.02 | 90.3 | — | — | |
| IVC-PruneBackbone Model=InternVL 2.5 8B, Average Tokens=50%2026.02 | 90.3 | — | — | |
| InternVL-2.5-8B2026.04 | 90.3 | — | — | |
| InternVL-3-1B + EGMBackbone=InternVL-3-1B, Enhancement=EGM2026.01 | 90.2 | — | — | |
| QwenVL2.5-7BModel Size=7B2026.02 | 90.2 | — | — | |
| GriffonBackbone=LLama2-13B2026.01 | 90.1 | — | — | |
| Qwen2.5-VLNumber of Parameters=7B2025.02 | 90 | — | — | |
| VisionLLM v2Model Category=Vision-Centric VLM, Model Parameters=7B, Task-specific decoders (*)=true, Task-specific fine-tuning=false2026.01 | 90 | — | — | |
| Qwen3-VL-4B-ThinkingBackbone=Qwen3-VL-4B, Variant=Thinking2026.01 | 90 | — | — | |
| Qwen2.5-VL-7B2026.04 | 90 | — | — | |
| Qwen3-VLvariant=Instruct2026.04 | 89.9 | — | — | |
| InternVL-3-2BBackbone=InternVL-3-2B2026.01 | 89.8 | — | — | |
| DeepEyes2026.04 | 89.8 | — | — | |
| VanillaBackbone Model=Qwen2.5-VL 7B, Average Tokens=100%2026.02 | 89.6 | — | — | |
| RoboInter-Qwen-3BModel Size=3B, Backbone=Qwen2026.02 | 89.5 | — | — | |
| Ferret#PT=1.1M, #FT=127K2025.03 | 89.5 | — | — | |
| QWen-VL-7BLLM=Qwen-7B2023.11 | 89.36 | — | — | |
| Qwen-VL-7BModel Size=7B, Zero-shot=false2024.02 | 89.36 | — | — | |
| IVC-PruneBackbone Model=Qwen2.5-VL 7B, Average Tokens=50%2026.02 | 89.3 | — | — | |
| Qwen2.5-VLNumber of Parameters=3B2025.02 | 89.1 | — | — | |
| QwenVL2.5-3BModel Size=3B2026.02 | 89.1 | — | — | |
| STORM2026.04 | 89.1 | — | — | |
| Qwen3-VL-2B-InstructBackbone=Qwen3-VL-2B, Variant=Instruct2026.01 | 88.7 | — | — | |
| M-GPT22026.04 | 88.7 | — | — | |
| MiniGPT-v2-7BLLM=LLaMA2-7B2023.11 | 88.69 | — | — | |
| Lumen-7BModel Category=Generalist2024.03 | 88.59 | — | — | |
| UNICORN2023.05 | 88.29 | — | — | |
| VistaLLM-7BModel Size=7B, Zero-shot=false2024.02 | 88.1 | — | — | |
| G-GPT2026.04 | 88 | — | — | |
| VisionLLM v2Backbone=Swin-T2026.01 | 87.9 | — | — | |
| Shikra-13BLLM=Vicuna-13B2023.11 | 87.83 | — | — | |
| Shikra2026.02 | 87.8 | — | — | |
| Shik-13BParameters=13B2026.04 | 87.8 | — | — | |
| MDETRBackbone=ENB32026.01 | 87.5 | — | — | |
| Qwen3-VL-2B-ThinkingBackbone=Qwen3-VL-2B, Variant=Thinking2026.01 | 87.5 | — | — | |
| Ferret2026.04 | 87.5 | — | — | |
| Ferret-7BModel Size=7B, Zero-shot=false2024.02 | 87.49 | — | — | |
| CoLLaVO-7BModel Size=7B, Zero-shot=true2024.02 | 87.34 | — | — | |
| Localization Heads2026.04 | 87.2 | — | — |