Referring Expression Comprehension on RefCOCOg (val-u)
90.58AccuracyBARE-L
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| BARE-LVisual Encoder=BEiT-L [9], Fine-tuning protocol=Fine-tuning, Pre-training type=pretrained open-set detection model, Training dataset scope=mixed datasets2026.01 | 90.58 | — | — | — | |
| ONE-PEACEModel type=Specialist SOTAs (Specialist/Finetuned)2023.06 | 89.22 | — | — | — | |
| UNINEXT-HModel type=Specialist SOTAs (Specialist/Finetuned)2023.06 | 88.73 | — | — | — | |
| C³VG2025.01 | 87.68 | — | — | — | |
| G-DINO-LModel type=Specialist SOTAs (Specialist/Finetuned)2023.06 | 86.13 | — | — | — | |
| SimVG-TBVisual Encoder=ViT-L/32, Time (ms)=1012024.09 | 85.99 | — | — | — | |
| SimVG-DBVisual Encoder=ViT-L/32, Time (ms)=1162024.09 | 85.72 | — | — | — | |
| LION-12B2025.01 | 85.52 | — | — | — | |
| SimVG2025.01 | 85.38 | — | — | — | |
| EEVG2025.01 | 85.19 | — | — | — | |
| PolyFormer2025.01 | 84.46 | — | — | — | |
| GroundingDINO2025.01 | 84.15 | — | — | — | |
| Ferret2025.01 | 83.93 | — | — | — | |
| Shikra-13BModel type=Generalist VL SOTAs (w/o finetuning)2023.06 | 82.64 | — | — | — | |
| Shikra-7BModel type=Generalist VL SOTAs (w/o finetuning)2023.06 | 82.27 | — | — | — | |
| Upper BoundToken=2562024.06 | 82.27 | — | — | — | |
| MDETR2025.01 | 81.64 | — | — | — | |
| SimVG-DBVisual Encoder=ViT-B/32, Time (ms)=522024.09 | 80.37 | — | — | — | |
| VoCo-LLaMAToken=82024.06 | 80.36 | — | — | — | |
| SimVG-TBVisual Encoder=ViT-B/32, Time (ms)=442024.09 | 79.82 | — | — | — | |
| Referring TransformerVisual Features=RN101, Pretrain Images=100k, Multi-task=true2021.06 | 79.25 | — | — | — | |
| Referring TransformerVisual Features=RN50, Pretrain Images=100k, Multi-task=true2021.06 | 78.43 | — | — | — | |
| VoCo-LLaMAToken=12024.06 | 78.32 | — | — | — | |
| VILLA_LVisual Features=RN101, Pretrain Images=4.6M, Multi-task=false2021.06 | 76.18 | — | — | — | |
| TransVG++2025.01 | 76.18 | — | — | — | |
| VLTVGVisual Encoder=RN50, Time (ms)=79*2024.09 | 74.9 | — | — | — | |
| UNTIER_LVisual Features=RN101, Pretrain Images=4.6M, Multi-task=false2021.06 | 74.86 | — | — | — | |
| SeqTRVisual Encoder=DN53, Time (ms)=502024.09 | 74.86 | — | — | — | |
| Dyn.MDETRVisual Encoder=ViT-B/162024.09 | 74.14 | — | — | — | |
| PVD2025.01 | 73.81 | — | — | — | |
| Dyn. MDETR2025.01 | 72.21 | — | — | — | |
| SeqTR2025.01 | 71.35 | — | — | — | |
| Referring TransformerVisual Features=RN101, Pretrain Images=None, Multi-task=true2021.06 | 69.41 | — | — | — | |
| Referring TransformerVisual Features=RN50, Pretrain Images=None, Multi-task=true2021.06 | 69.32 | — | — | — | |
| TRARVisual Encoder=DN532024.09 | 68.9 | — | — | — | |
| TransVGVisual Encoder=RN101, Time (ms)=622024.09 | 68.67 | — | — | — | |
| CM-Att-EraseVisual Features=RN101, Pretrain Images=None, Multi-task=false2021.06 | 67.99 | — | — | — | |
| CM-Att-EraseVisual Encoder=RN1012024.09 | 67.99 | — | — | — | |
| OFA-L*Model type=Generalist VL SOTAs (w/o finetuning)2023.06 | 67.57 | — | — | — | |
| ReSC-LargeVisual Features=DN53, Pretrain Images=None, Multi-task=false2021.06 | 67.3 | — | — | — | |
| ReSCLVisual Encoder=DN53, Time (ms)=362024.09 | 67.3 | — | — | — | |
| RvG-TreeVisual Features=RN101, Pretrain Images=None, Multi-task=false2021.06 | 66.95 | — | — | — | |
| RvG-TreeVisual Encoder=RN1012024.09 | 66.95 | — | — | — | |
| MAttNetVisual Features=RN101, Pretrain Images=None, Multi-task=false2021.06 | 66.58 | — | — | — | |
| MAttNetVisual Encoder=RN101, Time (ms)=3202024.09 | 66.58 | — | — | — | |
| MCNVisual Features=DN53, Pretrain Images=None, Multi-task=true2021.06 | 66.46 | — | — | — | |
| MCNVisual Encoder=DN53, Time (ms)=562024.09 | 66.46 | — | — | — | |
| MCN2025.01 | 66.46 | — | — | — | |
| NMTreeVisual Features=RN101, Pretrain Images=None, Multi-task=false2021.06 | 65.87 | — | — | — | |
| RCCFVisual Encoder=DLA34, Time (ms)=252024.09 | 65.73 | — | — | — | |
| NMTreeVisual Encoder=RN1012024.09 | 64.62 | — | — | — | |
| VGTRVisual Encoder=RN502024.09 | 64.19 | — | — | — | |
| RealGINVisual Encoder=DN53, Time (ms)=352024.09 | 62.75 | — | — | — | |
| Lower BoundToken=12024.06 | 62.3 | — | — | — | |
| FAOAVisual Features=DN53, Pretrain Images=None, Multi-task=false2021.06 | 61.33 | — | — | — | |
| FAOAVisual Encoder=DN53, Time (ms)=392024.09 | 59.44 | — | — | — | |
| SSGVisual Features=DN53, Pretrain Images=None, Multi-task=false2021.06 | 58.8 | — | — | — | |
| G-DINO-LModel Type=Specialist2023.11 | — | — | 86.13 | — | |
| MDETRVisual Features=ROBERTa, Pretrain Images=200k, Multi-task=true, Image Backbone=ResNet-1012021.06 | — | 81.64 | — | — | |
| MDETR2022.02 | — | — | 81.64 | — | |
| MDETR2023.03 | — | — | — | 81.64 | |
| MiniGPT-v2 7BModel Type=Generalist2023.11 | — | — | 84.44 | — | |
| MiniGPT-v2 7B-chatModel Type=Generalist2023.11 | — | — | 84.19 | — | |
| OFAmodel_size=Huge2022.02 | — | — | 88.07 | — | |
| OFA Basemodel_size=Base2022.02 | — | — | 82.29 | — | |
| OFA Largemodel_size=Large2022.02 | — | — | 85.89 | — | |
| OFA Mediummodel_size=Medium2022.02 | — | — | 78.76 | — | |
| OFA Tinymodel_size=Tiny2022.02 | — | — | 72.02 | — | |
| OFA-LModel Type=Generalist2023.11 | — | — | 67.57 | — | |
| Qwen-VL-7BModel Type=Generalist2023.11 | — | — | 85.58 | — | |
| Qwen-VL-7B-ChatModel Type=Generalist2023.11 | — | — | 85.96 | — | |
| Referring TransformerVisual Features=BERT, Pretrain Images=None, Multi-task=true, Image Backbone=ResNet-1012021.06 | — | 69.41 | — | — | |
| Referring TransformerVisual Features=BERT, Pretrain Images=100k, Multi-task=true, Image Backbone=ResNet-1012021.06 | — | 79.25 | — | — | |
| RefTR2023.03 | — | — | — | 79.25 | |
| SeqTR2023.03 | — | — | — | 82.69 | |
| Shikra 13BModel Type=Generalist2023.11 | — | — | 82.64 | — | |
| Shikra 7BModel Type=Generalist2023.11 | — | — | 82.27 | — | |
| SPHINXModel Type=Generalist2023.11 | — | — | 84.87 | — | |
| SPHINX-1kModel Type=Generalist2023.11 | — | — | 88.19 | — | |
| SPHINX-2kModel Type=Generalist2023.11 | — | — | 88.07 | — | |
| TransVGVisual Features=BERT, Pretrain Images=None, Multi-task=false, Image Backbone=ResNet-1012021.06 | — | 68.67 | — | — | |
| UNICORN2022.02 | — | — | 83.44 | — | |
| UNINEXTBackbone=ResNet-502023.03 | — | — | — | 83.95 | |
| UNINEXTBackbone=ConvNeXt-Large2023.03 | — | — | — | 86.91 | |
| UNINEXTBackbone=ViT-Huge2023.03 | — | — | — | 88.73 | |
| UNINEXTModel Type=Specialist2023.11 | — | — | 88.73 | — | |
| UNITER2022.02 | — | — | 74.86 | — | |
| UNITER2023.03 | — | — | — | 74.86 | |
| VGTRVisual Features=Bi-LSTM, Pretrain Images=None, Multi-task=false, Image Backbone=ResNet-1012021.06 | — | 65.73 | — | — | |
| VILLA2022.02 | — | — | 76.18 | — | |
| VILLA2023.03 | — | — | — | 76.18 |