Referring Expression Comprehension on RefCOCOg (test-u)
89.37PrecisionUNINEXT-H
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UNINEXT-HModel type=Specialist SOTAs (Specialist/Finetuned)2023.06 | 89.37 | — | |
| ONE-PEACEModel type=Specialist SOTAs (Specialist/Finetuned)2023.06 | 89.27 | — | |
| OFAmodel_size=Huge2022.02 | 88.78 | — | |
| C³VG2025.01 | 88.31 | — | |
| G-DINO-LModel type=Specialist SOTAs (Specialist/Finetuned)2023.06 | 87.02 | — | |
| SimVG-TBVisual Encoder=ViT-L/32, Time (ms)=1012024.09 | 86.83 | — | |
| SimVG-DBVisual Encoder=ViT-L/32, Time (ms)=1162024.09 | 86.7 | — | |
| OFA Largemodel_size=Large2022.02 | 86.55 | — | |
| SimVG2025.01 | 86.28 | — | |
| LION-12B2025.01 | 85.74 | — | |
| PolyFormer2025.01 | 84.96 | — | |
| GroundingDINO2025.01 | 84.94 | — | |
| Ferret2025.01 | 84.76 | — | |
| EEVG2025.01 | 84.72 | — | |
| UNICORN2022.02 | 83.93 | — | |
| Shikra-13BModel type=Generalist VL SOTAs (w/o finetuning)2023.06 | 83.16 | — | |
| OFA Basemodel_size=Base2022.02 | 82.31 | — | |
| Shikra-7BModel type=Generalist VL SOTAs (w/o finetuning)2023.06 | 82.19 | — | |
| Upper BoundToken=2562024.06 | 82.19 | — | |
| MDETRVisual Features=ROBERTa, Pretrain Images=200k, Multi-task=true, Image Backbone=ResNet-1012021.06 | 80.89 | — | |
| MDETR2022.02 | 80.89 | — | |
| MDETR2025.01 | 80.89 | — | |
| VoCo-LLaMAToken=82024.06 | 80.64 | — | |
| SimVG-DBVisual Encoder=ViT-B/32, Time (ms)=522024.09 | 80.51 | — | |
| Referring TransformerVisual Features=BERT, Pretrain Images=100k, Multi-task=true, Image Backbone=ResNet-1012021.06 | 80.01 | — | |
| Referring TransformerVisual Features=RN101, Pretrain Images=100k, Multi-task=true2021.06 | 80.01 | — | |
| SimVG-TBVisual Encoder=ViT-B/32, Time (ms)=442024.09 | 79.93 | — | |
| OFA Mediummodel_size=Medium2022.02 | 78.58 | — | |
| VoCo-LLaMAToken=12024.06 | 78.06 | — | |
| Referring TransformerVisual Features=RN50, Pretrain Images=100k, Multi-task=true2021.06 | 77.86 | — | |
| VILLA_LVisual Features=RN101, Pretrain Images=4.6M, Multi-task=false2021.06 | 76.71 | — | |
| VILLA2022.02 | 76.71 | — | |
| TransVG++2025.01 | 76.3 | — | |
| UNTIER_LVisual Features=RN101, Pretrain Images=4.6M, Multi-task=false2021.06 | 75.77 | — | |
| UNITER2022.02 | 75.77 | — | |
| Dyn.MDETRVisual Encoder=ViT-B/162024.09 | 74.49 | — | |
| SeqTRVisual Encoder=DN53, Time (ms)=502024.09 | 74.21 | — | |
| Dyn. MDETR2025.01 | 74.14 | — | |
| PVD2025.01 | 74.13 | — | |
| VLTVGVisual Encoder=RN50, Time (ms)=79*2024.09 | 73.88 | — | |
| SeqTR2025.01 | 71.58 | — | |
| VL-T52022.02 | 71.3 | — | |
| OFA Tinymodel_size=Tiny2022.02 | 69.74 | — | |
| Referring TransformerVisual Features=BERT, Pretrain Images=None, Multi-task=true, Image Backbone=ResNet-1012021.06 | 69.4 | — | |
| Referring TransformerVisual Features=RN101, Pretrain Images=None, Multi-task=true2021.06 | 69.4 | — | |
| Referring TransformerVisual Features=RN50, Pretrain Images=None, Multi-task=true2021.06 | 69.1 | — | |
| CM-Att-EraseVisual Features=RN101, Pretrain Images=None, Multi-task=false2021.06 | 68.67 | — | |
| CM-Att-EraseVisual Encoder=RN1012024.09 | 68.67 | — | |
| TRARVisual Encoder=DN532024.09 | 68.3 | — | |
| TransVGVisual Features=BERT, Pretrain Images=None, Multi-task=false, Image Backbone=ResNet-1012021.06 | 67.73 | — | |
| TransVGVisual Encoder=RN101, Time (ms)=622024.09 | 67.73 | — | |
| OFA-L*Model type=Generalist VL SOTAs (w/o finetuning)2023.06 | 67.58 | — | |
| MAttNetVisual Features=RN101, Pretrain Images=None, Multi-task=false2021.06 | 67.27 | — | |
| MAttNetVisual Encoder=RN101, Time (ms)=3202024.09 | 67.27 | — | |
| VGTRVisual Features=Bi-LSTM, Pretrain Images=None, Multi-task=false, Image Backbone=ResNet-1012021.06 | 67.23 | — | |
| ReSC-LargeVisual Features=DN53, Pretrain Images=None, Multi-task=false2021.06 | 67.2 | — | |
| ReSCLVisual Encoder=DN53, Time (ms)=362024.09 | 67.2 | — | |
| RvG-TreeVisual Features=RN101, Pretrain Images=None, Multi-task=false2021.06 | 66.51 | — | |
| RvG-TreeVisual Encoder=RN1012024.09 | 66.51 | — | |
| NMTreeVisual Features=RN101, Pretrain Images=None, Multi-task=false2021.06 | 66.44 | — | |
| MCNVisual Features=DN53, Pretrain Images=None, Multi-task=true2021.06 | 66.01 | — | |
| MCNVisual Encoder=DN53, Time (ms)=562024.09 | 66.01 | — | |
| MCN2025.01 | 66.01 | — | |
| NMTreeVisual Encoder=RN1012024.09 | 65.87 | — | |
| RCCFVisual Features=DLA34, Pretrain Images=None, Multi-task=false2021.06 | 65.73 | — | |
| VGTRVisual Encoder=RN502024.09 | 64.01 | — | |
| RCCFVisual Encoder=DLA34, Time (ms)=252024.09 | 63.79 | — | |
| Lower BoundToken=12024.06 | 62.99 | — | |
| RealGINVisual Encoder=DN53, Time (ms)=352024.09 | 62.33 | — | |
| FAOAVisual Features=DN53, Pretrain Images=None, Multi-task=false2021.06 | 60.36 | — | |
| FAOAVisual Encoder=DN53, Time (ms)=392024.09 | 58.9 | — | |
| G-DINO-LModel Type=Specialist2023.11 | — | 87.02 | |
| MDETR2023.03 | — | 80.89 | |
| MiniGPT-v2 7BModel Type=Generalist2023.11 | — | 84.66 | |
| MiniGPT-v2 7B-chatModel Type=Generalist2023.11 | — | 84.31 | |
| OFA-LModel Type=Generalist2023.11 | — | 67.58 | |
| Qwen-VL-7BModel Type=Generalist2023.11 | — | 85.48 | |
| Qwen-VL-7B-ChatModel Type=Generalist2023.11 | — | 86.32 | |
| RefTR2023.03 | — | 80.01 | |
| SeqTR2023.03 | — | 83.37 | |
| Shikra 13BModel Type=Generalist2023.11 | — | 83.16 | |
| Shikra 7BModel Type=Generalist2023.11 | — | 82.19 | |
| SPHINXModel Type=Generalist2023.11 | — | 83.65 | |
| SPHINX-1kModel Type=Generalist2023.11 | — | 88.35 | |
| SPHINX-2kModel Type=Generalist2023.11 | — | 88.65 | |
| UNINEXTBackbone=ResNet-502023.03 | — | 84.31 | |
| UNINEXTBackbone=ConvNeXt-Large2023.03 | — | 87.48 | |
| UNINEXTBackbone=ViT-Huge2023.03 | — | 89.37 | |
| UNINEXTModel Type=Specialist2023.11 | — | 89.37 | |
| UNITER2023.03 | — | 75.77 | |
| VILLA2023.03 | — | 76.71 |