Visual Grounding on RefCOCO+ (testB+)
85.4AccuracyYoutu-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Youtu-VLModel Size=4B2026.01 | 85.4 | |
| Florence-2Backbone=DaViT-B2026.01 | 83.6 | |
| UFOBackbone=InternVL2.5-8B2026.01 | 82.3 | |
| InternVL-3.5Model Size=4B2026.01 | 81.6 | |
| GriffonBackbone=LLama2-13B2026.01 | 77.8 | |
| Grounding DINOBackbone=Swin-L2026.01 | 75.9 | |
| Qwen3-VLModel Size=4B2026.01 | 75.6 | |
| MDETRBackbone=ENB32026.01 | 73 | |
| VisionLLM v2Backbone=Swin-T2026.01 | 70.2 | |
| GLaMMBackbone=Vicuna-7B2026.01 | 64.6 |