Referring Expression Comprehension on RefCOCO+ (test-B)
85.6AccuracyQwen2-VL-72B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen2-VL-72BType=Generalist2024.09 | 85.6 | — | — | — | — | |
| InternVL3.5-38B2025.12 | 84.7 | — | — | — | — | |
| CogVLMType=Generalist2024.09 | 83.4 | — | — | — | — | |
| CogVLM-GroundingType=Generalist2023.11 | 83.39 | — | — | — | — | |
| CogVLM-17BModel Size=17B2024.07 | 83.39 | — | — | — | — | |
| VGent2025.12 | 83.3 | — | — | — | — | |
| ONE-PEACEModel type=Specialist SOTAs (Specialist/Finetuned)2023.06 | 83.23 | — | — | — | — | |
| ONE-PEACEModel type=Specialist SOTAs2023.08 | 83.23 | — | — | — | — | |
| ONE-PEACEType=Specialist2023.11 | 83.23 | — | — | — | — | |
| ONE-PEACEType=Specialist2024.09 | 83.2 | — | — | — | — | |
| ONE-PEACE2025.12 | 83.2 | — | — | — | — | |
| InternVL2-26BType=Generalist2024.09 | 82.8 | — | — | — | — | |
| InternVL3.5-20B-A4B2025.12 | 82.7 | — | — | — | — | |
| InternVL3.5-8B2025.12 | 82.4 | — | — | — | — | |
| InternVL3-8B2025.12 | 81.8 | — | — | — | — | |
| InternVL3-14B2025.12 | 81.5 | — | — | — | — | |
| C³VG2025.01 | 81.42 | — | — | — | — | |
| Ferret-v2Type=Generalist2024.09 | 81.4 | — | — | — | — | |
| Ferret-v2-13B2025.12 | 81.4 | — | — | — | — | |
| InternVL3-9B2025.12 | 79.9 | — | — | — | — | |
| UNINEXT-HType=Specialist2024.09 | 79.8 | — | — | — | — | |
| UNINEXT-H2025.12 | 79.8 | — | — | — | — | |
| UNINEXT-HModel type=Specialist SOTAs (Specialist/Finetuned)2023.06 | 79.79 | — | — | — | — | |
| UNINEXT-HModel type=Specialist SOTAs2023.08 | 79.79 | — | — | — | — | |
| UNINEXTModel type=Specialist models2023.10 | 79.79 | — | — | — | — | |
| UNINEXT-HType=Specialist2023.11 | 79.79 | — | — | — | — | |
| UNINEXT-HModel type=Specialist Models2023.12 | 79.79 | — | — | — | — | |
| Qwen2-VL-7BType=Generalist2024.09 | 79.5 | — | — | — | — | |
| Qwen2-VL-7B2025.12 | 79.5 | — | — | — | — | |
| OFA-LVisual Backbone=RN152, Text Encoder=Embedding layer2023.02 | 79.22 | — | — | — | — | |
| CoS-7BModel Size=7B, Fine-tuning protocol=LoRA2024.07 | 78.63 | — | — | — | — | |
| LION-12BEvaluation Setting=Fine-tuning Setting2023.11 | 78.06 | — | — | — | — | |
| LION-12B2025.01 | 78.06 | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.02 | 77.97 | — | — | — | — | |
| SimVG2025.01 | 77.5 | — | — | — | — | |
| LION-4BEvaluation Setting=Fine-tuning Setting2023.11 | 77.34 | — | — | — | — | |
| Qwen-VL-7BModel type=Generalist Models2023.08 | 77.21 | — | — | — | — | |
| Qwen-VLType=Generalist2023.11 | 77.21 | — | — | — | — | |
| Qwen-VL-7BModel Size=7B2024.07 | 77.21 | — | — | — | — | |
| Qwen-VLType=Generalist2024.09 | 77.2 | — | — | — | — | |
| Qwen2.5-VL-7B2025.12 | 76.9 | — | — | — | — | |
| ASMv2-13BParameters=13B2024.02 | 76.89 | — | — | — | — | |
| Qwen-VL-7B-ChatModel type=Generalist Models2023.08 | 76.79 | — | — | — | — | |
| Qwen-VLModel type=Generalist Models, Backbone=Qwen-7B2023.12 | 76.79 | — | — | — | — | |
| Qwen-VL-7BParameters=7B2024.02 | 76.79 | — | — | — | — | |
| LyricsModel type=Generalist Models, Backbone=Vicuna-13B2023.12 | 76.72 | — | — | — | — | |
| PolyFormer-BVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 76.38 | — | — | — | — | |
| PolyFormer2025.01 | 76.38 | — | — | — | — | |
| Griffon v22024.07 | 76.2 | — | — | — | — | |
| G-DINO-LModel type=Specialist SOTAs (Specialist/Finetuned)2023.06 | 75.92 | — | — | — | — | |
| G-DINO-LModel type=Specialist SOTAs2023.08 | 75.92 | — | — | — | — | |
| G-DINO-LModel type=Specialist models2023.10 | 75.92 | — | — | — | — | |
| G-DINO-LType=Specialist2023.11 | 75.92 | — | — | — | — | |
| G-DINO-LModel type=Specialist Models2023.12 | 75.92 | — | — | — | — | |
| G-DINO-LType=Specialist2024.09 | 75.9 | — | — | — | — | |
| Grounding-DINO-L2025.12 | 75.9 | — | — | — | — | |
| Elysium (7B)Resolution=336, Visual token count=1082024.03 | 75.64 | — | — | — | — | |
| VL-BERT LARGERegion Source=Ground-truth Regions2019.08 | 75.45 | — | — | — | — | |
| Ferret-13BEvaluation Setting=Fine-tuning Setting2023.11 | 75.17 | — | — | — | — | |
| Ferret-13BType=Generalist2023.11 | 75.17 | — | — | — | — | |
| Ferret-13BModel Size=13B2024.07 | 75.17 | — | — | — | — | |
| Ferret-13BParameters=13B2024.02 | 75.17 | — | — | — | — | |
| VL-BERT BASERegion Source=Ground-truth Regions2019.08 | 75.01 | — | — | — | — | |
| Aligned VLPAlignment=Supervised2022.03 | 75 | — | — | — | — | |
| EEVG2025.01 | 74.94 | — | — | — | — | |
| GroundingDINO2025.01 | 74.71 | — | — | — | — | |
| MiniGPT-v2 (7B)Model type=Generalist models2023.10 | 74.45 | — | — | — | — | |
| MiniGPTv2Evaluation Setting=Fine-tuning Setting2023.11 | 74.45 | — | — | — | — | |
| MiniGPT-v2 (7B)Resolution=448, Visual token count=256, utilizes larger ViT=true2024.03 | 74.45 | — | — | — | — | |
| MiniGPTv2Fine-tuning protocol=LoRA2024.07 | 74.45 | — | — | — | — | |
| Shikra-13BModel type=Generalist VL SOTAs (w/o finetuning)2023.06 | 74.41 | — | — | — | — | |
| Shikra-13BModel type=Generalist Models2023.08 | 74.41 | — | — | — | — | |
| Shikra (13B)Model type=Generalist models2023.10 | 74.41 | — | — | — | — | |
| Shikra-13BEvaluation Setting=Fine-tuning Setting2023.11 | 74.41 | — | — | — | — | |
| Shikra-13BType=Generalist2023.11 | 74.41 | — | — | — | — | |
| Shikra (13B)Resolution=224, Visual token count=2562024.03 | 74.41 | — | — | — | — | |
| ShikraModel type=Generalist Models, Backbone=Vicuna-13B2023.12 | 74.41 | — | — | — | — | |
| Shikra-13BModel Size=13B2024.07 | 74.41 | — | — | — | — | |
| Shikra-13BParameters=13B2024.02 | 74.41 | — | — | — | — | |
| OFA-BVisual Backbone=RN101, Text Encoder=Embedding layer2023.02 | 74.29 | — | — | — | — | |
| μ-VLACCPre-training Data=CC, Alignment=Unsupervised2022.03 | 73.7 | — | — | — | — | |
| PinkEvaluation Setting=Fine-tuning Setting2023.11 | 73.7 | — | — | — | — | |
| MiniGPT-v2 (7B)-chatModel type=Generalist models2023.10 | 73.32 | — | — | — | — | |
| MiniGPT-v2-7BParameters=7B2024.02 | 73.32 | — | — | — | — | |
| GroundingGPT (7B)Resolution=336, Visual token count=5762024.03 | 73.18 | — | — | — | — | |
| Ferret-7BEvaluation Setting=Fine-tuning Setting2023.11 | 73.14 | — | — | — | — | |
| Ferret (7B)Resolution=336, Visual token count=6082024.03 | 73.14 | — | — | — | — | |
| Ferret-7BModel Size=7B2024.07 | 73.14 | — | — | — | — | |
| Ferret2025.01 | 73.14 | — | — | — | — | |
| MDETRVisual Backbone=ENB3, Text Encoder=RoBERTa-base2023.02 | 72.96 | — | — | — | — | |
| μ-VLABCPre-training Data=BC, Alignment=Unsupervised2022.03 | 72.7 | — | — | — | — | |
| Shikra-7BModel type=Generalist VL SOTAs (w/o finetuning)2023.06 | 72.12 | — | — | — | — | |
| Shikra-7BModel type=Generalist Models2023.08 | 72.12 | — | — | — | — | |
| Shikra (7B)Model type=Generalist models2023.10 | 72.12 | — | — | — | — | |
| Shikra-7BEvaluation Setting=Fine-tuning Setting2023.11 | 72.12 | — | — | — | — | |
| Shikra-7BType=Generalist2023.11 | 72.12 | — | — | — | — | |
| Shikra (7B)Resolution=224, Visual token count=2562024.03 | 72.12 | — | — | — | — | |
| ShikraModel type=Generalist Models, Backbone=Vicuna-7B2023.12 | 72.12 | — | — | — | — | |
| Shikra-7BModel Size=7B2024.07 | 72.12 | — | — | — | — | |
| Shikra-7BParameters=7B2024.02 | 72.12 | — | — | — | — |