Referring Expression Comprehension on RefCOCO (val)
93.7AccuracyInternVL2.5-78B
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| InternVL2.5-78BParameters=78B2024.12 | 93.7 | — | — | — | — | — | — | — | |
| Qwen2-VL-72BType=Generalist2024.09 | 93.2 | — | — | — | — | — | — | — | |
| Qwen2-VL-72BParameters=72B2024.12 | 93.2 | — | — | — | — | — | — | — | |
| CogVLMType=Generalist2024.09 | 92.8 | — | — | — | — | — | — | — | |
| CogVLM-Grounding-17BParameters=17B2024.12 | 92.8 | — | — | — | — | — | — | — | |
| CogVLM-GroundingType=Generalist2023.11 | 92.76 | — | — | — | — | — | — | — | |
| CogVLM-17BModel Size=17B2024.07 | 92.76 | — | — | — | — | — | — | — | |
| UNINEXT-HModel type=Specialist SOTAs (Specialist/Finetuned)2023.06 | 92.64 | — | — | — | — | — | — | — | |
| UNINEXT-HModel type=Specialist SOTAs2023.08 | 92.64 | — | — | — | — | — | — | — | |
| UNINEXTModel type=Specialist models2023.10 | 92.64 | — | — | — | — | — | — | — | |
| UNINEXT-HModel Type=Specialist SOTAs2023.11 | 92.64 | — | — | — | — | — | — | — | |
| UNINEXT-HType=Specialist2023.11 | 92.64 | — | — | — | — | — | — | — | |
| UNINEXT-HType=Specialist2024.03 | 92.64 | — | — | — | — | — | — | — | |
| UNINEXT-HModel type=Specialist Models2023.12 | 92.64 | — | — | — | — | — | — | — | |
| Supervised SOTA2023.11 | 92.64 | — | — | — | — | — | — | — | |
| Ferret-v2Type=Generalist2024.09 | 92.6 | — | — | — | — | — | — | — | |
| UNINEXT-HType=Specialist2024.09 | 92.6 | — | — | — | — | — | — | — | |
| ONE-PEACEType=Specialist2024.09 | 92.6 | — | — | — | — | — | — | — | |
| UNINEXT-H2025.12 | 92.6 | — | — | — | — | — | — | — | |
| ONE-PEACE2025.12 | 92.6 | — | — | — | — | — | — | — | |
| Ferret-v2-13Bparameters=13B2025.12 | 92.6 | — | — | — | — | — | — | — | |
| UNINEXT-HBackbone=Huge2024.12 | 92.6 | — | — | — | — | — | — | — | |
| ONE-PEACE2024.12 | 92.6 | — | — | — | — | — | — | — | |
| Ferret-v2-13BParameters=13B2024.12 | 92.6 | — | — | — | — | — | — | — | |
| VILLA_LARGEdetected proposals=false, Model Scale=LARGE2020.06 | 92.58 | — | — | — | — | — | — | — | |
| ONE-PEACEModel type=Specialist SOTAs (Specialist/Finetuned)2023.06 | 92.58 | — | — | — | — | — | — | — | |
| ONE-PEACEModel type=Specialist SOTAs2023.08 | 92.58 | — | — | — | — | — | — | — | |
| ONE-PEACEType=Specialist2023.11 | 92.58 | — | — | — | — | — | — | — | |
| ONE-PEACEType=Specialist2024.03 | 92.58 | — | — | — | — | — | — | — | |
| CogVLM2023.12 | 92.51 | — | — | — | — | — | — | — | |
| C³VGBackbone=BEIT3-ViT-B, Data Size=28K, Time (ms)=51, Task Type=Generalist Models2025.01 | 92.51 | — | — | — | — | — | — | — | |
| InternVL3-8Bparameters=8B2025.12 | 92.5 | — | — | — | — | — | — | — | |
| InternVL3.5-8Bparameters=8B2025.12 | 92.4 | — | — | — | — | — | — | — | |
| VGent2025.12 | 92.4 | — | — | — | — | — | — | — | |
| InternVL2-26BType=Generalist2024.09 | 92.2 | — | — | — | — | — | — | — | |
| InternVL2-Llama3-76BBackbone=Llama3, Parameters=76B2024.12 | 92.2 | — | — | — | — | — | — | — | |
| InternVL3-14Bparameters=14B2025.12 | 92 | — | — | — | — | — | — | — | |
| VILLA_BASEdetected proposals=false, Model Scale=BASE2020.06 | 91.93 | — | — | — | — | — | — | — | |
| InternVL3.5-20B-A4Bparameters=20B-A4B2025.12 | 91.9 | — | — | — | — | — | — | — | |
| TextHawk22024.12 | 91.9 | — | — | — | — | — | — | — | |
| UNITER_LARGEdetected proposals=false, Model Scale=LARGE2020.06 | 91.84 | — | — | — | — | — | — | — | |
| InternVL3-9Bparameters=9B2025.12 | 91.8 | — | — | — | — | — | — | — | |
| Qwen2-VL-7BType=Generalist2024.09 | 91.7 | — | — | — | — | — | — | — | |
| Qwen2-VL-7Bparameters=7B2025.12 | 91.7 | — | — | — | — | — | — | — | |
| Qwen2-VL-7BType=MLLM2025.12 | 91.7 | — | — | — | — | — | — | — | |
| Qwen2-VL-7BParameters=7B2024.12 | 91.7 | — | — | — | — | — | — | — | |
| UNITER_BASEdetected proposals=false, Model Scale=BASE2020.06 | 91.64 | — | — | — | — | — | — | — | |
| CoT4DET-7BType=MLLM2025.12 | 91.6 | — | — | — | — | — | — | — | |
| CoS-7BModel Size=7B, Fine-tuning protocol=LoRA2024.07 | 90.72 | — | — | — | — | — | — | — | |
| LyricsModel type=Generalist Models, Backbone=Vicuna-13B2023.12 | 90.69 | — | — | — | — | — | — | — | |
| FIBER-BPre-training data (Im-Txt)=true, Pre-training data (Im-Txt-Box)=true2022.06 | 90.68 | — | — | — | — | — | — | — | |
| FIBERzero-shot=false2023.06 | 90.68 | — | — | — | — | — | — | — | |
| SimVG-TBVisual Encoder=ViT-L/32, Time (ms)=1012024.09 | 90.61 | — | — | — | — | — | — | — | |
| G-DINO-LType=Specialist2024.09 | 90.6 | — | — | — | — | — | — | — | |
| Grounding-DINO-L2025.12 | 90.6 | — | — | — | — | — | — | — | |
| Grounding-DINO-LBackbone=Large2024.12 | 90.6 | — | — | — | — | — | — | — | |
| SimVGBackbone=BEIT3-ViT-B, Data Size=174K, Time (ms)=44, Task Type=Single-task2025.01 | 90.59 | — | — | — | — | — | — | — | |
| G-DINO-LModel type=Specialist SOTAs (Specialist/Finetuned)2023.06 | 90.56 | — | — | — | — | — | — | — | |
| G-DINO-LModel type=Specialist SOTAs2023.08 | 90.56 | — | — | — | — | — | — | — | |
| G-DINO-LModel type=Specialist models2023.10 | 90.56 | — | — | — | — | — | — | — | |
| G-DINO-LType=Specialist2023.11 | 90.56 | — | — | — | — | — | — | — | |
| G-DINO-LType=Specialist2024.03 | 90.56 | — | — | — | — | — | — | — | |
| G-DINO-LModel type=Specialist Models2023.12 | 90.56 | — | — | — | — | — | — | — | |
| ASMv2-13BParameters=13B2024.02 | 90.56 | — | — | — | — | — | — | — | |
| SimVG-DBVisual Encoder=ViT-L/32, Time (ms)=1162024.09 | 90.51 | — | — | — | — | — | — | — | |
| EEVGBackbone=ViT-B, Data Size=174K, Time (ms)=117, Task Type=Multi-task2025.01 | 90.47 | — | — | — | — | — | — | — | |
| Emu2-Chat2023.12 | 90.4 | — | — | — | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.02 | 90.38 | — | — | — | — | — | — | — | |
| InternVL3.5-38Bparameters=38B2025.12 | 90.3 | — | — | — | — | — | — | — | |
| GETok-R1Learning Paradigm=Reinforcement Learning, Evaluation Protocol=Acc@0.52025.12 | 90.3 | — | 90.9 | — | — | — | — | — | |
| InternVL2.5-8BParameters=8B2024.12 | 90.3 | — | — | — | — | — | — | — | |
| OFA-LPre-training data (Im-Txt)=true, Pre-training data (Im-Txt-Box)=true2022.06 | 90.05 | — | — | — | — | — | — | — | |
| OFA-LVisual Backbone=RN152, Text Encoder=Embedding layer2023.02 | 90.05 | — | — | — | — | — | — | — | |
| OFAzero-shot=false2023.06 | 90.05 | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7Bparameters=7B2025.12 | 90 | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BType=MLLM2025.12 | 90 | — | — | — | — | — | — | — | |
| LION-12BEvaluation Setting=Fine-tuning Setting2023.11 | 89.8 | — | — | — | — | — | — | — | |
| LION-12BBackbone=Flan-T5-11B, Data Size=3.6M, Task Type=Generalist Models2025.01 | 89.8 | — | — | — | — | — | — | — | |
| PolyFormer-BVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 89.73 | — | — | — | — | — | — | — | |
| LION-4BEvaluation Setting=Fine-tuning Setting2023.11 | 89.73 | — | — | — | — | — | — | — | |
| PolyFormerBackbone=Swin-B, Data Size=174K, Time (ms)=152, Task Type=Multi-task2025.01 | 89.73 | — | — | — | — | — | — | — | |
| Qwen-VLType=Generalist, tuning=SC-Tune, Locator training stage (Lsup)=true2024.03 | 89.61 | — | — | — | — | — | — | — | |
| Griffon v22024.07 | 89.6 | — | — | — | — | — | — | — | |
| GETok-R1-gridLearning Paradigm=Reinforcement Learning, Evaluation Protocol=Acc@0.52025.12 | 89.6 | — | 90.2 | — | — | — | — | — | |
| MM-G-T(c3)Backbone=Swin-T, Setting=5e2024.01 | 89.5 | — | — | — | — | — | — | — | |
| Groma-7BType=MLLM2025.12 | 89.5 | — | — | — | — | — | — | — | |
| Ferret-13BEvaluation Setting=Fine-tuning Setting2023.11 | 89.48 | — | — | — | — | — | — | — | |
| Ferret-13BType=Generalist2023.11 | 89.48 | — | — | — | — | — | — | — | |
| Ferret-13BModel Size=13B2024.07 | 89.48 | — | — | — | — | — | — | — | |
| Ferret-13BParameters=13B2024.02 | 89.48 | — | — | — | — | — | — | — | |
| Qwen-VLType=Generalist2024.09 | 89.4 | — | — | — | — | — | — | — | |
| CoLAUpdate Ratio=17.2%2026.04 | 89.4 | — | — | — | — | — | — | — | |
| Qwen-VL-7BModel type=Generalist Models2023.08 | 89.36 | — | — | — | — | — | — | — | |
| Qwen-VLType=Generalist2023.11 | 89.36 | — | — | — | — | — | — | — | |
| Qwen-VL-7B2023.12 | 89.36 | — | — | — | — | — | — | — | |
| Qwen-VL-7BModel Size=7B2024.07 | 89.36 | — | — | — | — | — | — | — | |
| G-DINO-T(c)Backbone=Swin-T, Setting=fine-tuned2024.01 | 89.2 | — | — | — | — | — | — | — | |
| Grounding DINOType=Open-set Detection Model2025.12 | 89.2 | — | — | — | — | — | — | — | |
| GroundingDINOBackbone=Swin-T, Data Size=2.0M, Time (ms)=120, Task Type=Single-task2025.01 | 89.19 | — | — | — | — | — | — | — | |
| PerceptionGPT-13BModel Type=Generalist VL SOTAs2023.11 | 89.17 | — | — | — | — | — | — | — |