Visual Grounding on RefCOCO+ (val)
91.4AccuracyVanilla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VanillaBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=100%2026.02 | 91.4 | — | |
| InternVL2.5Number of Parameters=78B2025.02 | 90.4 | — | |
| IVC-PruneBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=52%2026.02 | 90.3 | — | |
| Youtu-VLModel Size=4B2026.01 | 90.1 | — | |
| Qwen3-VL-8B-Thinking + EGMBackbone=Qwen3-VL-8B, Enhancement=EGM2026.01 | 90.1 | — | |
| InternVL-3-78BBackbone=InternVL-3-78B2026.01 | 90.1 | — | |
| Qwen3-VL-4B-Thinking + EGMBackbone=Qwen3-VL-4B, Enhancement=EGM2026.01 | 89.7 | — | |
| Qwen3-VL-235B-A22B-ThinkingBackbone=Qwen3-VL-235B-A22B, Variant=Thinking2026.01 | 89.5 | — | |
| InternVL-3-8B + EGMBackbone=InternVL-3-8B, Enhancement=EGM2026.01 | 89.3 | — | |
| W-FastVBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=54%2026.02 | 89.2 | — | |
| PDropBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=57%2026.02 | 89 | — | |
| Qwen2.5-VLNumber of Parameters=72B2025.02 | 88.9 | — | |
| Qwen2.5-VLModel Size=72B2026.04 | 88.9 | — | |
| ONE-PEACE2026.05 | 88.8 | — | |
| ONE-PEACE2023.05 | 88.77 | — | |
| CogVLM-G2026.05 | 88.7 | — | |
| CogVLM-Grounding-17BModel Size=17B, Zero-shot=false2024.02 | 88.68 | — | |
| Qwen3-VL-235B-A22B-InstructBackbone=Qwen3-VL-235B-A22B, Variant=Instruct2026.01 | 88.6 | — | |
| Florence-2Backbone=DaViT-B2026.01 | 88.3 | — | |
| Florence-2-L#PT=126M, #FT=127K2025.03 | 88.3 | — | |
| Grounding DINO2025.02 | 88.2 | — | |
| InternVL-3-8BBackbone=InternVL-3-8B2026.01 | 88.2 | — | |
| InternVL3-8BModel Size=8B2026.02 | 88.2 | — | |
| Grounding DINO2026.04 | 88.2 | — | |
| OpenVLThinkerV22026.04 | 88.2 | — | |
| InternVL3.5-8B2026.05 | 87.9 | — | |
| OFA2023.05 | 87.86 | — | |
| FastVBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=54%2026.02 | 87.8 | — | |
| Qwen3-VL-2B-Thinking + EGMBackbone=Qwen3-VL-2B, Enhancement=EGM2026.01 | 87.8 | — | |
| Qwen3-VLvariant=GDPO2026.04 | 87.8 | — | |
| UFOBackbone=InternVL2.5-8B2026.01 | 87.7 | — | |
| Qwen3-VLvariant=GRPO2026.04 | 87.7 | — | |
| X2-VLM_large# Params=593M, Pre-training Data=More Data2022.11 | 87.6 | — | |
| InternVL-3.5Model Size=4B2026.01 | 87.6 | — | |
| GR3D-8B2026.05 | 87.5 | — | |
| Ferretv2#PT=1.1M, #FT=127K2025.03 | 87.4 | — | |
| Phi3V-dist#PT=0, #FT=127K2025.03 | 87.1 | — | |
| OneThinker-8B2026.04 | 87 | — | |
| X2-VLM_large# Params=593M, Pre-training Data=4M2022.11 | 86.9 | — | |
| Florence-2-B#PT=126M, #FT=127K2025.03 | 86.8 | — | |
| RoboInter-Qwen-7BModel Size=7B, Backbone=Qwen2026.02 | 86.6 | — | |
| Qwen2.5-VL-7B AIFAIF=true2026.04 | 86.6 | — | |
| Qwen3-VL-8B-ThinkingBackbone=Qwen3-VL-8B, Variant=Thinking2026.01 | 86.2 | — | |
| TextHawk22026.05 | 86.2 | — | |
| X-FMbase# Params=327M, Training Data=More Data2023.01 | 86.1 | — | |
| Phi3V-sft#PT=0, #FT=127K2025.03 | 85.9 | — | |
| Phi3V-vocab#PT=0, #FT=127K2025.03 | 85.9 | — | |
| OFA_large# Params=472M, Pre-training Data=More Data2022.11 | 85.8 | — | |
| Qwen3-VL-8B-InstructBackbone=Qwen3-VL-8B, Variant=Instruct2026.01 | 85.8 | — | |
| RoboInter-Qwen-3BModel Size=3B, Backbone=Qwen2026.02 | 85.8 | — | |
| Qwen2-VL-7B2026.05 | 85.8 | — | |
| FIBER2023.05 | 85.74 | — | |
| InternVL-3-2B + EGMBackbone=InternVL-3-2B, Enhancement=EGM2026.01 | 85.6 | — | |
| X2-VLM_base# Params=255M, Pre-training Data=4M2022.11 | 85.4 | — | |
| X2-VLMbase# Params=255M2023.01 | 85.4 | — | |
| UNINEXTModel Category=Specialist2024.03 | 85.24 | — | |
| X2-VLM_base# Params=255M, Pre-training Data=More Data2022.11 | 85.2 | — | |
| X2-VLMbase# Params=255M, Training Data=More Data2023.01 | 85.2 | — | |
| Qwen3-VL-4B-ThinkingBackbone=Qwen3-VL-4B, Variant=Thinking2026.01 | 85.2 | — | |
| InternVL-2.5-8B2026.04 | 85.2 | — | |
| UNINEXT#PT=600K, #FT=127K2025.03 | 85.2 | — | |
| UNINEXT-H2026.05 | 85.2 | — | |
| VanillaBackbone Model=InternVL 2.5 8B, Average Tokens=100%2026.02 | 85.1 | — | |
| X-FMbase# Params=327M2023.01 | 84.8 | — | |
| IVC-PruneBackbone Model=InternVL 2.5 8B, Average Tokens=50%2026.02 | 84.8 | — | |
| GriffonBackbone=LLama2-13B2026.01 | 84.8 | — | |
| X-VLMPre-training Images Scale=16M2021.11 | 84.51 | — | |
| X-VLM2023.05 | 84.51 | — | |
| Qwen3-VLvariant=Instruct2026.04 | 84.5 | — | |
| Qwen3-VL-4B-InstructBackbone=Qwen3-VL-4B, Variant=Instruct2026.01 | 84.4 | — | |
| VLM-R12026.04 | 84.3 | — | |
| Qwen2.5-VLNumber of Parameters=7B2025.02 | 84.2 | — | |
| QwenVL2.5-7BModel Size=7B2026.02 | 84.2 | — | |
| RoboInter-LLaVAOV-7BModel Size=7B, Backbone=LLaVA-OV2026.02 | 84.2 | — | |
| Qwen2.5-VL-7B2026.04 | 84.2 | — | |
| Qwen2.5-VLModel Size=7B2026.04 | 84.2 | — | |
| Qwen2.5-VL-7B2026.05 | 84.2 | — | |
| InternVL-3-2BBackbone=InternVL-3-2B2026.01 | 84 | — | |
| InternVL3-2BModel Size=2B2026.02 | 84 | — | |
| InternVL3-2B2026.05 | 84 | — | |
| InternVL-3-1B + EGMBackbone=InternVL-3-1B, Enhancement=EGM2026.01 | 83.8 | — | |
| ForeSightModel Size=7B2026.04 | 83.66 | — | |
| DeepEyes2026.04 | 83.6 | — | |
| DeepEyesModel Size=7B2026.04 | 83.6 | — | |
| QWen-VL-7BLLM=Qwen-7B2023.11 | 83.12 | — | |
| Qwen-VL-7BModel Size=7B, Zero-shot=false2024.02 | 83.12 | — | |
| VistaLLM-7BModel Size=7B, Zero-shot=false2024.02 | 82.9 | — | |
| Qwen3-VLModel Size=4B2026.01 | 82.9 | — | |
| Shikra-13BLLM=Vicuna-13B2023.11 | 82.89 | — | |
| VanillaBackbone Model=Qwen2.5-VL 7B, Average Tokens=100%2026.02 | 82.8 | — | |
| Grounding DINOBackbone=Swin-L2026.01 | 82.8 | — | |
| Shikra2026.02 | 82.8 | — | |
| Grounding-DINO-L2026.04 | 82.8 | — | |
| Ferret#PT=1.1M, #FT=127K2025.03 | 82.8 | — | |
| Grounding-DINO-L2026.05 | 82.8 | — | |
| Grounding-DINO2023.05 | 82.75 | — | |
| G-DINO-LModel Category=Specialist2024.03 | 82.75 | — | |
| Localization Heads2026.04 | 82.7 | — | |
| InternVL3.5-2B2026.05 | 82.7 | — | |
| Qwen2.5-VLNumber of Parameters=3B2025.02 | 82.4 | — |