Visual Grounding on RefCOCO+ (testA+)
93.9AccuracyYoutu-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Youtu-VLModel Size=4B2026.01 | 93.9 | |
| Florence-2Backbone=DaViT-B2026.01 | 92.9 | |
| InternVL-3.5Model Size=4B2026.01 | 92.3 | |
| UFOBackbone=InternVL2.5-8B2026.01 | 92.1 | |
| GriffonBackbone=LLama2-13B2026.01 | 90.5 | |
| Qwen3-VLModel Size=4B2026.01 | 89.4 | |
| Grounding DINOBackbone=Swin-L2026.01 | 89 | |
| MDETRBackbone=ENB32026.01 | 85.5 | |
| VisionLLM v2Backbone=Swin-T2026.01 | 83.8 | |
| GLaMMBackbone=Vicuna-7B2026.01 | 78.7 |