Visual Grounding on RefCOCO+ (testB)
87.9AccuracyVanilla
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VanillaBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=100%2026.02 | 87.9 | — | — | — | |
| InternVL2.5Number of Parameters=78B2025.02 | 86.9 | — | — | — | |
| IVC-PruneBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=52%2026.02 | 86.6 | — | — | — | |
| Qwen3-VL-8B-Thinking + EGMBackbone=Qwen3-VL-8B, Enhancement=EGM2026.01 | 85.9 | — | — | — | |
| Qwen3-VL-235B-A22B-ThinkingBackbone=Qwen3-VL-235B-A22B, Variant=Thinking2026.01 | 85.5 | — | — | — | |
| InternVL-3-78BBackbone=InternVL-3-78B2026.01 | 85.3 | — | — | — | |
| W-FastVBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=54%2026.02 | 85.2 | — | — | — | |
| Qwen3-VL-4B-Thinking + EGMBackbone=Qwen3-VL-4B, Enhancement=EGM2026.01 | 84.9 | — | — | — | |
| PDropBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=57%2026.02 | 84.5 | — | — | — | |
| Qwen3-VL-235B-A22B-InstructBackbone=Qwen3-VL-235B-A22B, Variant=Instruct2026.01 | 84.2 | — | — | — | |
| Qwen2.5-VLNumber of Parameters=72B2025.02 | 83.7 | — | — | — | |
| FastVBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=54%2026.02 | 83.6 | — | — | — | |
| Florence-2-L#PT=126M, #FT=127K2025.03 | 83.6 | — | — | — | |
| CogVLM-G2026.05 | 83.4 | — | — | — | |
| CogVLM-Grounding-17BModel Size=17B, Zero-shot=false2024.02 | 83.39 | — | — | — | |
| ONE-PEACE2023.05 | 83.23 | — | — | — | |
| ONE-PEACE2026.05 | 83.2 | — | — | — | |
| InternVL-3-8B + EGMBackbone=InternVL-3-8B, Enhancement=EGM2026.01 | 83.1 | — | — | — | |
| Qwen3-VL-2B-Thinking + EGMBackbone=Qwen3-VL-2B, Enhancement=EGM2026.01 | 82.7 | — | — | — | |
| InternVL3.5-8B2026.05 | 82.4 | — | — | — | |
| Florence-2-B#PT=126M, #FT=127K2025.03 | 82.2 | — | — | — | |
| InfMLLM-7BLLM=Vicuna-7B2023.11 | 81.83 | — | — | — | |
| X2-VLM_large# Params=593M, Pre-training Data=More Data2022.11 | 81.8 | — | — | — | |
| InternVL-3-8BBackbone=InternVL-3-8B2026.01 | 81.8 | — | — | — | |
| Phi3V-dist#PT=0, #FT=127K2025.03 | 81.4 | — | — | — | |
| GR3D-8B2026.05 | 81 | — | — | — | |
| OFA2023.05 | 80.71 | — | — | — | |
| Qwen2.5-VL-7B AIFAIF=true2026.04 | 80.5 | — | — | — | |
| TextHawk22026.05 | 80.4 | — | — | — | |
| X2-VLM_large# Params=593M, Pre-training Data=4M2022.11 | 80.2 | — | — | — | |
| Qwen3-VL-8B-ThinkingBackbone=Qwen3-VL-8B, Variant=Thinking2026.01 | 80.2 | — | — | — | |
| Qwen3-VL-8B-InstructBackbone=Qwen3-VL-8B, Variant=Instruct2026.01 | 79.9 | — | — | — | |
| X-FMbase# Params=327M, Training Data=More Data2023.01 | 79.8 | — | — | — | |
| UNINEXT#PT=600K, #FT=127K2025.03 | 79.8 | — | — | — | |
| UNINEXT-H2026.05 | 79.8 | — | — | — | |
| UNINEXTModel Category=Specialist2024.03 | 79.79 | — | — | — | |
| Qwen2-VL-7B2026.05 | 79.5 | — | — | — | |
| FIBER2023.05 | 79.38 | — | — | — | |
| Qwen3-VL-4B-ThinkingBackbone=Qwen3-VL-4B, Variant=Thinking2026.01 | 79.3 | — | — | — | |
| Ferretv2#PT=1.1M, #FT=127K2025.03 | 79.3 | — | — | — | |
| OFA_large# Params=472M, Pre-training Data=More Data2022.11 | 79.2 | — | — | — | |
| InternVL-3-2B + EGMBackbone=InternVL-3-2B, Enhancement=EGM2026.01 | 79.2 | — | — | — | |
| VanillaBackbone=QWEN-2.5-VL 7B, Average Tokens=100%2026.02 | 79.15 | — | — | — | |
| X-FMbase# Params=327M2023.01 | 79.1 | — | — | — | |
| InternVL-2.5-8B2026.04 | 78.8 | — | — | — | |
| VanillaBackbone Model=InternVL 2.5 8B, Average Tokens=100%2026.02 | 78.7 | — | — | — | |
| Phi3V-sft#PT=0, #FT=127K2025.03 | 78.7 | — | — | — | |
| X2-VLM_base# Params=255M, Pre-training Data=More Data2022.11 | 78.4 | — | — | — | |
| X2-VLMbase# Params=255M, Training Data=More Data2023.01 | 78.4 | — | — | — | |
| IVC-PruneBackbone Model=InternVL 2.5 8B, Average Tokens=50%2026.02 | 78.2 | — | — | — | |
| Qwen3-VL-4B-InstructBackbone=Qwen3-VL-4B, Variant=Instruct2026.01 | 78.2 | — | — | — | |
| Phi3V-vocab#PT=0, #FT=127K2025.03 | 78.2 | — | — | — | |
| InternVL-3-1B + EGMBackbone=InternVL-3-1B, Enhancement=EGM2026.01 | 77.5 | — | — | — | |
| X2-VLM_base# Params=255M, Pre-training Data=4M2022.11 | 77.3 | — | — | — | |
| X2-VLMbase# Params=255M2023.01 | 77.3 | — | — | — | |
| QWen-VL-7BLLM=Qwen-7B2023.11 | 77.21 | — | — | — | |
| Qwen-VL-7BModel Size=7B, Zero-shot=false2024.02 | 77.21 | — | — | — | |
| NuwaBackbone=QWEN-2.5-VL 7B, Average Tokens=75%2026.02 | 77.18 | — | — | — | |
| X-VLMPre-training Images Scale=16M2021.11 | 76.91 | — | — | — | |
| X-VLM2023.05 | 76.91 | — | — | — | |
| Qwen2.5-VLNumber of Parameters=7B2025.02 | 76.9 | — | — | — | |
| Qwen2.5-VL-7B2026.04 | 76.9 | — | — | — | |
| Qwen2.5-VL-7B2026.05 | 76.9 | — | — | — | |
| InternVL3.5-2B2026.05 | 76.6 | — | — | — | |
| InternVL-3-2BBackbone=InternVL-3-2B2026.01 | 76.5 | — | — | — | |
| InternVL3-2B2026.05 | 76.5 | — | — | — | |
| Grounding-DINO2023.05 | 75.92 | — | — | — | |
| G-DINO-LModel Category=Specialist2024.03 | 75.92 | — | — | — | |
| Grounding DINO2025.02 | 75.9 | — | — | — | |
| Grounding-DINO-L2026.04 | 75.9 | — | — | — | |
| Grounding-DINO-L2026.05 | 75.9 | — | — | — | |
| Ferret#PT=1.1M, #FT=127K2025.03 | 75.2 | — | — | — | |
| VistaLLM-7BModel Size=7B, Zero-shot=false2024.02 | 74.8 | — | — | — | |
| MiniGPT-v2-7BLLM=LLaMA2-7B2023.11 | 74.45 | — | — | — | |
| Shikra-13BLLM=Vicuna-13B2023.11 | 74.41 | — | — | — | |
| Shikra2026.02 | 74.4 | — | — | — | |
| OFA_base# Params=182M, Pre-training Data=More Data2022.11 | 74.3 | — | — | — | |
| OFAbase# Params=182M2023.01 | 74.3 | — | — | — | |
| VanillaBackbone Model=Qwen2.5-VL 7B, Average Tokens=100%2026.02 | 74.3 | — | — | — | |
| Qwen2.5-VLNumber of Parameters=3B2025.02 | 74.1 | — | — | — | |
| IVC-PruneBackbone Model=Qwen2.5-VL 7B, Average Tokens=50%2026.02 | 74.1 | — | — | — | |
| Qwen2.5-VL-3B2026.05 | 74.1 | — | — | — | |
| Localization Heads2026.04 | 74 | — | — | — | |
| CoLLaVO-7BModel Size=7B, Zero-shot=true2024.02 | 73.2 | — | — | — | |
| Ferret-7BModel Size=7B, Zero-shot=false2024.02 | 73.14 | — | — | — | |
| Qwen3-VL-2B-InstructBackbone=Qwen3-VL-2B, Variant=Instruct2026.01 | 73.1 | — | — | — | |
| NuwaBackbone=QWEN-2.5-VL 7B, Average Tokens=50%2026.02 | 72.65 | — | — | — | |
| AutoToolSize=7B2026.05 | 72.6 | — | — | — | |
| Lumen-7BModel Category=Generalist2024.03 | 72.2 | — | — | — | |
| Shikra-7BLLM=Vicuna-7B2023.11 | 72.12 | — | — | — | |
| Shikra-7BModel Category=Generalist2024.03 | 72.12 | — | — | — | |
| Shikra-7BModel Size=7B, Zero-shot=false2024.02 | 72.12 | — | — | — | |
| Qwen3-VL-2B-ThinkingBackbone=Qwen3-VL-2B, Variant=Thinking2026.01 | 72.1 | — | — | — | |
| Shikra-7B2026.04 | 72.1 | — | — | — | |
| Shikra-7B2026.05 | 72.1 | — | — | — | |
| UNICORN2023.05 | 71.88 | — | — | — | |
| SeqTRVisual Encoder=DN53, Params (M)=7.90, Pre-train images=174K2022.03 | 71.87 | — | — | — | |
| InternVL2-8B2026.04 | 71.4 | — | — | — | |
| X-VLMPre-training Images Scale=4M2021.11 | 71 | — | — | — | |
| X-VLM# Params=216M2023.01 | 71 | — | — | — |