Referring Expression Comprehension on RefCOCO v1 (val)
92.83Top-1 AccuracyBARE-L
Evaluation Results
| Method | Links | |
|---|---|---|
| BARE-LVisual Encoder=BEiT-L [9], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained open-set detection model, Training dataset scope=mixed datasets2026.01 | 92.83 | |
| ObjEmbedParameters=4B2026.02 | 92.5 | |
| BARE-LVisual Encoder=BEiT-L [9], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained vision-language model, Training dataset scope=single dataset2026.01 | 92.37 | |
| ObjEmbedParameters=2B2026.02 | 91.7 | |
| CLARE-LSize=Large2026.02 | 91.4 | |
| VLM-FO1Parameters=3B2026.02 | 91.1 | |
| ChatRexParameters=7B2026.02 | 91 | |
| HyperLearnerPre-training Data=O365, GoldG, RefC, Fine-tuning=true2024.04 | 90.74 | |
| Qwen3-VLParameters=4B2026.02 | 90.7 | |
| SimVG-LVenue=NeurIPS’24, Visual Encoder=BEiT-L [9], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained vision-language model, Training dataset scope=single dataset2026.01 | 90.61 | |
| Grounding-DINO-LSize=Large2026.02 | 90.6 | |
| InternVL2.5Parameters=8B2026.02 | 90.3 | |
| InternVL3.5Parameters=38B2026.02 | 90.3 | |
| BARE-BVisual Encoder=BEiT-B [9], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained open-set detection model, Training dataset scope=mixed datasets2026.01 | 90.28 | |
| VLM-R1Parameters=3B2026.02 | 90.1 | |
| OFA-LVenue=ICML’22, Visual Encoder=OFA-L [66], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained open-set detection model, Training dataset scope=mixed datasets2026.01 | 90.05 | |
| Qwen2.5-VLParameters=7B2026.02 | 90 | |
| Grounding-DINO-TPre-training Data=O365, GoldG, RefC, Fine-tuning=true2024.04 | 89.19 | |
| Grounding-DINOVenue=ECCV’24, Visual Encoder=Swin-T [12], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained open-set detection model, Training dataset scope=mixed datasets2026.01 | 89.19 | |
| Qwen2.5-VLParameters=3B2026.02 | 89.1 | |
| PLVLVenue=arXiv’25, Visual Encoder=ViT-B [29], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained vision-language model, Training dataset scope=single dataset2026.01 | 89.02 | |
| OctopusParameters=7B2026.02 | 89 | |
| BARE-BVisual Encoder=BEiT-B [9], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained vision-language model, Training dataset scope=single dataset2026.01 | 88.69 | |
| DQ-DETRPre-training Data=GoldG, RefC, Fine-tuning=true2024.04 | 88.63 | |
| DQ-DETRVenue=AAAI’23, Visual Encoder=RN101 [11], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained open-set detection model, Training dataset scope=mixed datasets2026.01 | 88.63 | |
| OFA-BVenue=ICML’22, Visual Encoder=OFA-B [66], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained open-set detection model, Training dataset scope=mixed datasets2026.01 | 88.48 | |
| Qwen3-VLParameters=2B2026.02 | 88.2 | |
| HiVG-LVenue=ACM MM’24, Visual Encoder=CLIP-L [29], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained vision-language model, Training dataset scope=single dataset2026.01 | 88.14 | |
| SimVG-BVenue=NeurIPS’24, Visual Encoder=BEiT-B [9], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained vision-language model, Training dataset scope=single dataset2026.01 | 87.63 | |
| HiVG-BVenue=ACM MM’24, Visual Encoder=CLIP-B [29], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained vision-language model, Training dataset scope=single dataset2026.01 | 87.32 | |
| DUETVenue=TCSVT’24, Visual Encoder=Swin-S [12], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained vision-language model, Training dataset scope=single dataset2026.01 | 87.27 | |
| SegVGVenue=ECCV’24, Visual Encoder=Swin-S [12], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained close-set detection and language model, Training dataset scope=single dataset2026.01 | 86.84 | |
| MFSDVenue=TCSVT’24, Visual Encoder=RN101 [11], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained close-set detection and language model, Training dataset scope=single dataset2026.01 | 86.82 | |
| MDETRPre-training Data=GoldG, RefC, Fine-tuning=true2024.04 | 86.75 | |
| Rex-OmniParameters=3B2026.02 | 86.6 | |
| UniTABVenue=ECCV’22, Visual Encoder=RN101 [11], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained open-set detection model, Training dataset scope=mixed datasets2026.01 | 86.32 | |
| VG-LAWVenue=CVPR’23, Visual Encoder=ViT-B [29], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained close-set detection and language model, Training dataset scope=single dataset2026.01 | 86.06 | |
| RefTRPre-training Data=VG, Fine-tuning=true2024.04 | 85.65 | |
| VLTVGVenue=CVPR’22, Visual Encoder=RN101 [11], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained close-set detection and language model, Training dataset scope=single dataset2026.01 | 84.77 | |
| CLIP-VGVenue=TMM’23, Visual Encoder=CLIP-B [29], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained vision-language model, Training dataset scope=single dataset2026.01 | 84.29 | |
| QRNetVenue=CVPR’22, Visual Encoder=Swin-S [12], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained close-set detection and language model, Training dataset scope=single dataset2026.01 | 84.01 | |
| YOROVenue=ECCV’22, Visual Encoder=ViLT [43], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained open-set detection model, Training dataset scope=mixed datasets2026.01 | 82.9 | |
| HyperLearnerPre-training Data=O365, GoldG, RefC, Fine-tuning=false2024.04 | 77.89 | |
| MAttNetPre-training Data=RefC, Fine-tuning=true2024.04 | 76.65 | |
| Grounding-DINO-TPre-training Data=O365, GoldG, RefC, Fine-tuning=false2024.04 | 73.98 | |
| HyperLearnerPre-training Data=O365, GoldG, Fine-tuning=false2024.04 | 50.66 | |
| GLIP-T(C)Pre-training Data=O365, GoldG, Cap4M, Fine-tuning=false2024.04 | 50.42 | |
| Grounding-DINO-TPre-training Data=O365, GoldG, Fine-tuning=false2024.04 | 50.41 | |
| GLIP-T(B)Pre-training Data=O365, GoldG, Fine-tuning=false2024.04 | 49.96 |