Visual Grounding on RefCOCOg (val)
93.2AccuracyVanilla
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VanillaBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=100%2026.02 | 93.2 | — | — | — | |
| Phi3V-dist#PT=0, #FT=127K2025.03 | 92.8 | — | — | — | |
| InternVL2.5Number of Parameters=78B2025.02 | 92.7 | — | — | — | |
| Phi3V-vocab#PT=0, #FT=127K2025.03 | 92.4 | — | — | — | |
| IVC-PruneBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=52%2026.02 | 92.2 | — | — | — | |
| Youtu-VLModel Size=4B2026.01 | 92.2 | — | — | — | |
| Phi3V-sft#PT=0, #FT=127K2025.03 | 92.2 | — | — | — | |
| InternVL-3-78BBackbone=InternVL-3-78B2026.01 | 91.5 | — | — | — | |
| PDropBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=57%2026.02 | 91.3 | — | — | — | |
| Florence-2Backbone=DaViT-B2026.01 | 91.2 | — | — | — | |
| Florence-2-L#PT=126M, #FT=127K2025.03 | 91.2 | — | — | — | |
| W-FastVBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=54%2026.02 | 90.9 | — | — | — | |
| FastVBackbone Model=DeepSeek-VL2 Small-16B, Average Tokens=54%2026.02 | 90.4 | — | — | — | |
| Qwen3-VL-4B-Thinking + EGMBackbone=Qwen3-VL-4B, Enhancement=EGM2026.01 | 90.4 | — | — | — | |
| Qwen3-VL-8B-Thinking + EGMBackbone=Qwen3-VL-8B, Enhancement=EGM2026.01 | 90.4 | — | — | — | |
| Qwen3-VL-235B-A22B-ThinkingBackbone=Qwen3-VL-235B-A22B, Variant=Thinking2026.01 | 90.4 | — | — | — | |
| OpenVLThinkerV22026.04 | 90.4 | — | — | — | |
| Qwen3-VL-235B-A22B-InstructBackbone=Qwen3-VL-235B-A22B, Variant=Instruct2026.01 | 90.3 | — | — | — | |
| Qwen2.5-VLNumber of Parameters=72B2025.02 | 89.9 | — | — | — | |
| Qwen2.5-VLModel Size=72B2026.04 | 89.9 | — | — | — | |
| Florence-2-B#PT=126M, #FT=127K2025.03 | 89.8 | — | — | — | |
| CogVLM-G2026.05 | 89.8 | — | — | — | |
| CogVLM-Grounding-17BModel Size=17B, Zero-shot=false2024.02 | 89.75 | — | — | — | |
| InternVL-3-8B + EGMBackbone=InternVL-3-8B, Enhancement=EGM2026.01 | 89.7 | — | — | — | |
| InternVL-3.5Model Size=4B2026.01 | 89.6 | — | — | — | |
| InternVL-3-8BBackbone=InternVL-3-8B2026.01 | 89.6 | — | — | — | |
| InternVL3-8BModel Size=8B2026.02 | 89.6 | — | — | — | |
| Qwen3-VLvariant=GRPO2026.04 | 89.6 | — | — | — | |
| InternVL3.5-8B2026.05 | 89.6 | — | — | — | |
| GR3D-8B2026.05 | 89.5 | — | — | — | |
| Ferretv2#PT=1.1M, #FT=127K2025.03 | 89.4 | — | — | — | |
| Qwen2.5-VL-7B AIFAIF=true2026.04 | 89.3 | — | — | — | |
| OneThinker-8B2026.04 | 89.2 | — | — | — | |
| ONE-PEACE2026.05 | 89.2 | — | — | — | |
| Qwen3-VLvariant=GDPO2026.04 | 88.9 | — | — | — | |
| UNINEXTModel Category=Specialist2024.03 | 88.73 | — | — | — | |
| Qwen3-VL-8B-InstructBackbone=Qwen3-VL-8B, Variant=Instruct2026.01 | 88.7 | — | — | — | |
| UNINEXT#PT=600K, #FT=127K2025.03 | 88.7 | — | — | — | |
| UNINEXT-H2026.05 | 88.7 | — | — | — | |
| Qwen3-VL-2B-Thinking + EGMBackbone=Qwen3-VL-2B, Enhancement=EGM2026.01 | 88.6 | — | — | — | |
| InternVL-3-2B + EGMBackbone=InternVL-3-2B, Enhancement=EGM2026.01 | 88.5 | — | — | — | |
| ForeSightModel Size=7B2026.04 | 88.43 | — | — | — | |
| RoboInter-Qwen-7BModel Size=7B, Backbone=Qwen2026.02 | 88.4 | — | — | — | |
| Qwen3-VL-4B-InstructBackbone=Qwen3-VL-4B, Variant=Instruct2026.01 | 88.3 | — | — | — | |
| UFOBackbone=InternVL2.5-8B2026.01 | 88.2 | — | — | — | |
| TextHawk22026.05 | 88.2 | — | — | — | |
| RoboInter-Qwen-3BModel Size=3B, Backbone=Qwen2026.02 | 87.9 | — | — | — | |
| Qwen3-VL-4B-ThinkingBackbone=Qwen3-VL-4B, Variant=Thinking2026.01 | 87.8 | — | — | — | |
| Qwen3-VL-8B-ThinkingBackbone=Qwen3-VL-8B, Variant=Thinking2026.01 | 87.6 | — | — | — | |
| InternVL-3-2BBackbone=InternVL-3-2B2026.01 | 87.6 | — | — | — | |
| InternVL3-2BModel Size=2B2026.02 | 87.6 | — | — | — | |
| InternVL3-2B2026.05 | 87.6 | — | — | — | |
| Qwen3-VLModel Size=4B2026.01 | 87.3 | — | — | — | |
| RoboInter-LLaVAOV-7BModel Size=7B, Backbone=LLaVA-OV2026.02 | 87.3 | — | — | — | |
| Qwen2-VL-7B2026.05 | 87.3 | — | — | — | |
| Qwen2.5-VLNumber of Parameters=7B2025.02 | 87.2 | — | — | — | |
| QwenVL2.5-7BModel Size=7B2026.02 | 87.2 | — | — | — | |
| Qwen2.5-VL-7B2026.04 | 87.2 | — | — | — | |
| Qwen2.5-VLModel Size=7B2026.04 | 87.2 | — | — | — | |
| Qwen2.5-VL-7B2026.05 | 87.2 | — | — | — | |
| VanillaBackbone Model=InternVL 2.5 8B, Average Tokens=100%2026.02 | 87.1 | — | — | — | |
| VLM-R12026.04 | 87.1 | — | — | — | |
| VanillaBackbone Model=Qwen2.5-VL 7B, Average Tokens=100%2026.02 | 86.8 | — | — | — | |
| Qwen3-VLvariant=Instruct2026.04 | 86.8 | — | — | — | |
| DeepEyes2026.04 | 86.7 | — | — | — | |
| InternVL-2.5-8B2026.04 | 86.7 | — | — | — | |
| DeepEyesModel Size=7B2026.04 | 86.7 | — | — | — | |
| IVC-PruneBackbone Model=Qwen2.5-VL 7B, Average Tokens=50%2026.02 | 86.5 | — | — | — | |
| IVC-PruneBackbone Model=InternVL 2.5 8B, Average Tokens=50%2026.02 | 86.4 | — | — | — | |
| InternVL-3-1B + EGMBackbone=InternVL-3-1B, Enhancement=EGM2026.01 | 86.4 | — | — | — | |
| Qwen2.5-VLModel Size=7B, Reproduced=true2026.04 | 86.4 | — | — | — | |
| G-DINO-LModel Category=Specialist2024.03 | 86.13 | — | — | — | |
| Grounding DINO2025.02 | 86.1 | — | — | — | |
| Grounding DINOBackbone=Swin-L2026.01 | 86.1 | — | — | — | |
| GriffonBackbone=LLama2-13B2026.01 | 86.1 | — | — | — | |
| Grounding DINO2026.04 | 86.1 | — | — | — | |
| Grounding-DINO-L2026.04 | 86.1 | — | — | — | |
| Grounding-DINO-L2026.05 | 86.1 | — | — | — | |
| Ferret#PT=1.1M, #FT=127K2025.03 | 85.8 | — | — | — | |
| InternVL3.5-2B2026.05 | 85.6 | — | — | — | |
| QWen-VL-7BLLM=Qwen-7B2023.11 | 85.58 | — | — | — | |
| Qwen-VL-7BModel Size=7B, Zero-shot=false2024.02 | 85.58 | — | — | — | |
| Qwen2.5-VLNumber of Parameters=3B2025.02 | 85.2 | — | — | — | |
| QwenVL2.5-3BModel Size=3B2026.02 | 85.2 | — | — | — | |
| Qwen2.5-VL-3B2026.05 | 85.2 | — | — | — | |
| Qwen3-VL-2B-InstructBackbone=Qwen3-VL-2B, Variant=Instruct2026.01 | 84.8 | — | — | — | |
| MiniGPT-v2-7BLLM=LLaMA2-7B2023.11 | 84.44 | — | — | — | |
| Qwen3-VL-2B-ThinkingBackbone=Qwen3-VL-2B, Variant=Thinking2026.01 | 84.4 | — | — | — | |
| M-GPT22026.04 | 84.4 | — | — | — | |
| Localization Heads2026.04 | 84.3 | — | — | — | |
| STORM2026.04 | 84 | — | — | — | |
| Ferret-7BModel Size=7B, Zero-shot=false2024.02 | 83.93 | — | — | — | |
| VScanBackbone Model=Qwen2.5-VL 7B, Average Tokens=50%2026.02 | 83.9 | — | — | — | |
| Ferret2026.04 | 83.9 | — | — | — | |
| Lumen-7BModel Category=Generalist2024.03 | 83.62 | — | — | — | |
| VistaLLM-7BModel Size=7B, Zero-shot=false2024.02 | 83.6 | — | — | — | |
| MDETRBackbone=ENB32026.01 | 83.4 | — | — | — | |
| VisionLLM v2Backbone=Swin-T2026.01 | 82.9 | — | — | — | |
| InternVL-3-1BBackbone=InternVL-3-1B2026.01 | 82.8 | — | — | — | |
| InternVL3-1B2026.05 | 82.8 | — | — | — |