Referring Expression Comprehension on RefCOCO+ (testB)
86.9AccuracyInternVL3.5-241B-A28B
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| InternVL3.5-241B-A28BFPS=null2025.12 | 86.9 | — | — | — | — | — | |
| InternVL2.5-78BParameters=78B2024.12 | 86.9 | — | — | — | — | — | |
| WeDetect-Ref 4BFPS=5.32025.12 | 86.8 | — | — | — | — | — | |
| Qwen2-VL-72BParameters=72B2024.12 | 85.6 | — | — | — | — | — | |
| InternVL3.5Parameters=38B2026.02 | 84.7 | — | — | — | — | — | |
| InternVL3.5-38BFPS=null2025.12 | 84.7 | — | — | — | — | — | |
| CogVLM-Grounding-17BParameters=17B2024.12 | 83.4 | — | — | — | — | — | |
| ONE-PEACE2024.12 | 83.2 | — | — | — | — | — | |
| WeDetect-Ref 2BFPS=6.62025.12 | 83.1 | — | — | — | — | — | |
| InternVL2-Llama3-76BBackbone=Llama3, Parameters=76B2024.12 | 82.8 | — | — | — | — | — | |
| SimVG-DBVisual Encoder=ViT-L/32, Pre-train images=28K2024.09 | 82.41 | — | — | — | — | — | |
| InternVL3.5-8BFPS=null2025.12 | 82.4 | — | — | — | — | — | |
| SimVG-TBVisual Encoder=ViT-L/32, Pre-train images=28K2024.09 | 82.1 | — | — | — | — | — | |
| CogVLM2023.12 | 81.43 | — | — | — | — | — | |
| Ferret-v2-13BParameters=13B2024.12 | 81.4 | — | — | — | — | — | |
| VLM-FO1Parameters=3B2026.02 | 80.6 | — | — | — | — | — | |
| ObjEmbedParameters=4B2026.02 | 80.6 | — | — | — | — | — | |
| VLM-FO1 3BFPS=null2025.12 | 80.6 | — | — | — | — | — | |
| Emu2-Chat2023.12 | 80.47 | — | — | — | — | — | |
| TextHawk22024.12 | 80.4 | — | — | — | — | — | |
| CoT4DET-7BType=MLLM2025.12 | 80.1 | — | — | — | — | — | |
| VILLA_LARGEdetected proposals=false, Model Scale=LARGE2020.06 | 80 | — | — | — | — | — | |
| UNINEXT-HBackbone=Huge2024.12 | 79.8 | — | — | — | — | — | |
| UNINEXT-HModel Type=Specialist SOTAs2023.11 | 79.79 | — | — | — | — | — | |
| Supervised SOTA2023.11 | 79.79 | — | — | — | — | — | |
| UNITER_LARGEdetected proposals=false, Model Scale=LARGE2020.06 | 79.75 | — | — | — | — | — | |
| SimVG-TBVisual Encoder=ViT-L/32, Time (ms)=1012024.09 | 79.74 | — | — | — | — | — | |
| Qwen2-VL-7BType=MLLM2025.12 | 79.5 | — | — | — | — | — | |
| Qwen2-VL-7BParameters=7B2024.12 | 79.5 | — | — | — | — | — | |
| FIBER-BPre-training data (Im-Txt)=true, Pre-training data (Im-Txt-Box)=true2022.06 | 79.38 | — | — | — | — | — | |
| FIBERzero-shot=false2023.06 | 79.38 | — | — | — | — | — | |
| ChatRexParameters=7B2026.02 | 79.3 | — | — | — | — | — | |
| ChatRex 7BFPS=null2025.12 | 79.3 | — | — | — | — | — | |
| VILLA_BASEdetected proposals=false, Model Scale=BASE2020.06 | 79.22 | — | — | — | — | — | |
| OFA-LVisual Encoder=RN1522024.09 | 79.22 | — | — | — | — | — | |
| SimVG-DBVisual Encoder=ViT-B/32, Pre-train images=174K2024.09 | 79.12 | — | — | — | — | — | |
| UNITER_BASEdetected proposals=false, Model Scale=BASE2020.06 | 78.89 | — | — | — | — | — | |
| InternVL2.5Parameters=8B2026.02 | 78.8 | — | — | — | — | — | |
| InternVL2.5-8BFPS=null2025.12 | 78.8 | — | — | — | — | — | |
| InternVL2.5-8BParameters=8B2024.12 | 78.8 | — | — | — | — | — | |
| SimVG-DBVisual Encoder=ViT-L/32, Time (ms)=1162024.09 | 78.66 | — | — | — | — | — | |
| SimVG-DBVisual Encoder=ViT-B/32, Pre-train images=28K2024.09 | 78.53 | — | — | — | — | — | |
| mPLUG-2Visual Encoder=ViT-L/142024.09 | 78.17 | — | — | — | — | — | |
| Groma-7BType=MLLM2025.12 | 78.1 | — | — | — | — | — | |
| PolyFormerVisual Encoder=Swin-L2024.09 | 77.97 | — | — | — | — | — | |
| MM1.52024.12 | 77.8 | — | — | — | — | — | |
| OFA-LPre-training data (Im-Txt)=true, Pre-training data (Im-Txt-Box)=true2022.06 | 77.77 | — | — | — | — | — | |
| OFAzero-shot=false2023.06 | 77.77 | — | — | — | — | — | |
| SimVG-TBVisual Encoder=ViT-B/32, Pre-train images=174K2024.09 | 77.5 | — | — | — | — | — | |
| Qwen-VL-7B2023.12 | 77.21 | — | — | — | — | — | |
| Qwen2.5-VLParameters=7B2026.02 | 76.9 | — | — | — | — | — | |
| Qwen2.5-VL 7BFPS=null2025.12 | 76.9 | — | — | — | — | — | |
| Qwen2.5-VL-7BType=MLLM2025.12 | 76.9 | — | — | — | — | — | |
| VLM-R1Parameters=3B2026.02 | 76.8 | — | — | — | — | — | |
| VLM-R1 3BFPS=null2025.12 | 76.8 | — | — | — | — | — | |
| ObjEmbedParameters=2B2026.02 | 76.6 | — | — | — | — | — | |
| PolyFormerVisual Encoder=Swin-B2024.09 | 76.38 | — | — | — | — | — | |
| OctopusParameters=7B2026.02 | 76 | — | — | — | — | — | |
| Octopus 7BFPS=null2025.12 | 76 | — | — | — | — | — | |
| Grounding DINO-LBackbone=Swin-L, Pre-training Data=O365, OI, GoldG, Cap4M, COCO, RefC, Fine-tuning=true2023.03 | 75.92 | — | — | — | — | — | |
| Grounding-DINO-LSize=Large2026.02 | 75.9 | — | — | — | — | — | |
| Grounding-DINO-LFPS=3.12025.12 | 75.9 | — | — | — | — | — | |
| Grounding-DINO-LBackbone=Large2024.12 | 75.9 | — | — | — | — | — | |
| Qwen3-VLParameters=4B2026.02 | 75.6 | — | — | — | — | — | |
| Qwen3-VL 4BFPS=0.42025.12 | 75.6 | — | — | — | — | — | |
| VL-BERT_LARGEdetected proposals=false, Model Scale=LARGE2020.06 | 75.45 | — | — | — | — | — | |
| PerceptionGPT-13BModel Type=Generalist VL SOTAs2023.11 | 75.31 | — | — | — | — | — | |
| VL-BERT_BASEdetected proposals=false, Model Scale=BASE2020.06 | 75.01 | — | — | — | — | — | |
| Grounding DINO-TBackbone=Swin-T, Pre-training Data=O365, GoldG, RefC, Fine-tuning=true2023.03 | 74.71 | — | — | — | — | — | |
| GroundingDINOVisual Encoder=Swin-T2024.09 | 74.71 | — | — | — | — | — | |
| G-DINO-T(c)Backbone=Swin-T, Setting=fine-tuned2024.01 | 74.7 | — | — | — | — | — | |
| Grounding DINOType=Open-set Detection Model2025.12 | 74.7 | — | — | — | — | — | |
| Shikra-13BModel Type=Generalist VL SOTAs2023.11 | 74.41 | — | — | — | — | — | |
| Shikra-13B2023.12 | 74.41 | — | — | — | — | — | |
| CLARE-LSize=Large2026.02 | 74.4 | — | — | — | — | — | |
| PerceptionGPT-7BModel Type=Generalist VL SOTAs2023.11 | 74.21 | — | — | — | — | — | |
| Qwen2.5-VLParameters=3B2026.02 | 74.1 | — | — | — | — | — | |
| Qwen2.5-VL 3BFPS=null2025.12 | 74.1 | — | — | — | — | — | |
| MM-G-T(c3)Backbone=Swin-T, Setting=5e2024.01 | 74 | — | — | — | — | — | |
| DQ-DETRBackbone=R101, Pre-training Data=GoldG, RefC, Fine-tuning=true2023.03 | 73.21 | — | — | — | — | — | |
| DQ-DETRVisual Encoder=RN1012024.09 | 73.21 | — | — | — | — | — | |
| Shikra-7BModel Type=Generalist VL SOTAs2023.11 | 73.2 | — | — | — | — | — | |
| GroundingGPTLLM Size=7B, Additional image region perception modules=false2024.01 | 73.18 | — | — | — | — | — | |
| FerretLLM Size=7B, Additional image region perception modules=true2024.01 | 73.14 | — | — | — | — | — | |
| MDETRDetection backbone=ENB3, Pre-training image data=COCO, VG, Flickr30k (200k)2021.04 | 72.96 | — | — | — | — | — | |
| MDETR-BPre-training data (Im-Txt)=false, Pre-training data (Im-Txt-Box)=true2022.06 | 72.96 | — | — | — | — | — | |
| MDETRzero-shot=false2023.06 | 72.96 | — | — | — | — | — | |
| Shikra-7B2023.12 | 72.12 | — | — | — | — | — | |
| ShikraLLM Size=7B, Additional image region perception modules=false2024.01 | 72.12 | — | — | — | — | — | |
| Shikra-7BType=MLLM2025.12 | 72.1 | — | — | — | — | — | |
| Shikra-7BParameters=7B2024.12 | 72.1 | — | — | — | — | — | |
| CoLAUpdate Ratio=17.2%2026.04 | 71.9 | — | — | — | — | — | |
| UNICORN-BPre-training data (Im-Txt)=false, Pre-training data (Im-Txt-Box)=true2022.06 | 71.88 | — | — | — | — | — | |
| SeqTRVisual Encoder=DN532024.09 | 71.87 | — | — | — | — | — | |
| SimVG-DBVisual Encoder=ViT-B/32, Time (ms)=522024.09 | 71.82 | — | — | — | — | — | |
| UniTABVisual Encoder=RN1012024.09 | 71.55 | — | — | — | — | — | |
| Rex-OmniParameters=3B2026.02 | 71.4 | — | — | — | — | — | |
| Rex-Omni 3BFPS=null2025.12 | 71.4 | — | — | — | — | — | |
| InternVL2-7BType=MLLM2025.12 | 71.4 | — | — | — | — | — | |
| InternVL2-8BParameters=8B2024.12 | 71.4 | — | — | — | — | — |