Visual Grounding on RefCOCO+ (testA)
94.7AccuracyInternVL2.5
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| InternVL2.5Number of Parameters=78B2025.02 | 94.7 | — | — | |
| VanillaBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=100%2026.02 | 94.7 | — | — | |
| IVC-PruneBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=52%2026.02 | 94 | — | — | |
| InternVL-3-78BBackbone=InternVL-3-78B2026.01 | 93.8 | — | — | |
| PDropBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=57%2026.02 | 93.7 | — | — | |
| InternVL-3-8B + EGMBackbone=InternVL-3-8B, Enhancement=EGM2026.01 | 93.6 | — | — | |
| Qwen3-VL-8B-Thinking + EGMBackbone=Qwen3-VL-8B, Enhancement=EGM2026.01 | 93.3 | — | — | |
| Qwen3-VL-4B-Thinking + EGMBackbone=Qwen3-VL-4B, Enhancement=EGM2026.01 | 93.1 | — | — | |
| CogVLM-Grounding-17BModel Size=17B, Zero-shot=false2024.02 | 92.91 | — | — | |
| Florence-2-L#PT=126M, #FT=127K2025.03 | 92.9 | — | — | |
| CogVLM-G2026.05 | 92.9 | — | — | |
| Ferretv2#PT=1.1M, #FT=127K2025.03 | 92.8 | — | — | |
| VG-Refiner+EVF-SAMRefining Tool=EVF-SAM2025.12 | 92.7 | — | — | |
| W-FastVBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=54%2026.02 | 92.5 | — | — | |
| Qwen3-VL-235B-A22B-ThinkingBackbone=Qwen3-VL-235B-A22B, Variant=Thinking2026.01 | 92.5 | — | — | |
| InternVL-3-8BBackbone=InternVL-3-8B2026.01 | 92.5 | — | — | |
| Qwen3-VL-235B-A22B-InstructBackbone=Qwen3-VL-235B-A22B, Variant=Instruct2026.01 | 92.4 | — | — | |
| InternVL3.5-8B2026.05 | 92.4 | — | — | |
| InfMLLM-7BLLM=Vicuna-7B2023.11 | 92.36 | — | — | |
| ONE-PEACE2023.05 | 92.21 | — | — | |
| Qwen2.5-VLNumber of Parameters=72B2025.02 | 92.2 | — | — | |
| Phi3V-dist#PT=0, #FT=127K2025.03 | 92.2 | — | — | |
| ONE-PEACE2026.05 | 92.2 | — | — | |
| X2-VLM_large# Params=593M, Pre-training Data=More Data2022.11 | 92.1 | — | — | |
| FastVBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=54%2026.02 | 91.8 | — | — | |
| OFA2023.05 | 91.7 | — | — | |
| Qwen3-VL-2B-Thinking + EGMBackbone=Qwen3-VL-2B, Enhancement=EGM2026.01 | 91.7 | — | — | |
| Florence-2-B#PT=126M, #FT=127K2025.03 | 91.7 | — | — | |
| Phi3V-sft#PT=0, #FT=127K2025.03 | 91.6 | — | — | |
| VanillaBackbone Model=InternVL 2.5 8B, Average Tokens=100%2026.02 | 91.5 | — | — | |
| InternVL-2.5-8B2026.04 | 91.5 | — | — | |
| GR3D-8B2026.05 | 91.4 | — | — | |
| InternVL-3-2B + EGMBackbone=InternVL-3-2B, Enhancement=EGM2026.01 | 91.2 | — | — | |
| IVC-PruneBackbone Model=InternVL 2.5 8B, Average Tokens=50%2026.02 | 91.1 | — | — | |
| Qwen2.5-VL-7B AIFAIF=true2026.04 | 91 | — | — | |
| Phi3V-vocab#PT=0, #FT=127K2025.03 | 90.6 | — | — | |
| Qwen2-VL-7B2026.05 | 90.5 | — | — | |
| X-FMbase# Params=327M, Training Data=More Data2023.01 | 90.4 | — | — | |
| X2-VLM_base# Params=255M, Pre-training Data=More Data2022.11 | 90.3 | — | — | |
| X2-VLMbase# Params=255M, Training Data=More Data2023.01 | 90.3 | — | — | |
| Qwen3-VL-8B-InstructBackbone=Qwen3-VL-8B, Variant=Instruct2026.01 | 90.3 | — | — | |
| FIBER2023.05 | 90.13 | — | — | |
| X2-VLM_large# Params=593M, Pre-training Data=4M2022.11 | 90.1 | — | — | |
| TextHawk22026.05 | 90 | — | — | |
| OFA_large# Params=472M, Pre-training Data=More Data2022.11 | 89.9 | — | — | |
| VistaLLM-7BModel Size=7B, Zero-shot=false2024.02 | 89.8 | — | — | |
| X-FMbase# Params=327M2023.01 | 89.7 | — | — | |
| AutoToolSize=7B2026.05 | 89.7 | — | — | |
| UNINEXTModel Category=Specialist2024.03 | 89.63 | — | — | |
| UNINEXT#PT=600K, #FT=127K2025.03 | 89.6 | — | — | |
| UNINEXT-H2026.05 | 89.6 | — | — | |
| Qwen3-VL-4B-ThinkingBackbone=Qwen3-VL-4B, Variant=Thinking2026.01 | 89.5 | — | — | |
| Qwen3-VL-8B-ThinkingBackbone=Qwen3-VL-8B, Variant=Thinking2026.01 | 89.3 | — | — | |
| X2-VLM_base# Params=255M, Pre-training Data=4M2022.11 | 89.2 | — | — | |
| X2-VLMbase# Params=255M2023.01 | 89.2 | — | — | |
| InternVL-3-2BBackbone=InternVL-3-2B2026.01 | 89.2 | — | — | |
| InternVL3-2B2026.05 | 89.2 | — | — | |
| Qwen2.5-VLNumber of Parameters=7B2025.02 | 89.1 | — | — | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2025.12 | 89.1 | — | — | |
| Qwen2.5-VL-7B2026.04 | 89.1 | — | — | |
| Qwen2.5-VL-7B2026.05 | 89.1 | — | — | |
| VanillaBackbone=QWEN-2.5-VL 7B, Average Tokens=100%2026.02 | 89.02 | — | — | |
| X-VLMPre-training Images Scale=16M2021.11 | 89 | — | — | |
| X-VLM2023.05 | 89 | — | — | |
| Grounding DINO2025.02 | 89 | — | — | |
| Grounding-DINO-L2026.04 | 89 | — | — | |
| Grounding-DINO-L2026.05 | 89 | — | — | |
| Grounding-DINO2023.05 | 88.95 | — | — | |
| G-DINO-LModel Category=Specialist2024.03 | 88.95 | — | — | |
| InternVL-3-1B + EGMBackbone=InternVL-3-1B, Enhancement=EGM2026.01 | 88.8 | — | — | |
| Qwen3-VL-4B-InstructBackbone=Qwen3-VL-4B, Variant=Instruct2026.01 | 88.7 | — | — | |
| STORM2026.04 | 88.6 | — | — | |
| Localization Heads2026.04 | 88.5 | — | — | |
| InternVL3.5-2B2026.05 | 88.4 | — | — | |
| QWen-VL-7BLLM=Qwen-7B2023.11 | 88.25 | — | — | |
| Qwen-VL-7BModel Size=7B, Zero-shot=false2024.02 | 88.25 | — | — | |
| Ferret#PT=1.1M, #FT=127K2025.03 | 88.1 | — | — | |
| Qwen2.5-VLNumber of Parameters=3B2025.02 | 88 | — | — | |
| VanillaBackbone Model=Qwen2.5-VL 7B, Average Tokens=100%2026.02 | 88 | — | — | |
| Qwen2.5-VL-3B2026.05 | 88 | — | — | |
| NuwaBackbone=QWEN-2.5-VL 7B, Average Tokens=75%2026.02 | 87.98 | — | — | |
| InternVL2-8B2026.04 | 87.9 | — | — | |
| Shik-13BParameters=13B2026.04 | 87.8 | — | — | |
| Shikra-13BLLM=Vicuna-13B2023.11 | 87.79 | — | — | |
| Lumen-7BModel Category=Generalist2024.03 | 87.59 | — | — | |
| IVC-PruneBackbone Model=Qwen2.5-VL 7B, Average Tokens=50%2026.02 | 87.4 | — | — | |
| Shik-7BParameters=7B2026.04 | 87.4 | — | — | |
| Ferret2026.04 | 87.4 | — | — | |
| Shikra-7B2026.04 | 87.4 | — | — | |
| Shikra-7B2026.05 | 87.4 | — | — | |
| Ferret-7BModel Size=7B, Zero-shot=false2024.02 | 87.38 | — | — | |
| Shikra-7BLLM=Vicuna-7B2023.11 | 87.36 | — | — | |
| Shikra-7BModel Category=Generalist2024.03 | 87.36 | — | — | |
| Shikra-7BModel Size=7B, Zero-shot=false2024.02 | 87.36 | — | — | |
| OFA_base# Params=182M, Pre-training Data=More Data2022.11 | 87.2 | — | — | |
| OFAbase# Params=182M2023.01 | 87.2 | — | — | |
| G-GPT2026.04 | 87.2 | — | — | |
| DeepEyesSize=7B2026.05 | 87.2 | — | — | |
| NuwaBackbone=QWEN-2.5-VL 7B, Average Tokens=50%2026.02 | 86.74 | — | — | |
| Qwen3-VL-2B-ThinkingBackbone=Qwen3-VL-2B, Variant=Thinking2026.01 | 86.7 | — | — |