Referring Image Segmentation on RefCOCO+ (test A)
78.7oIoUGLaMM
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GLaMMPublication=CVPR 2024, Vision Model=SAM-H, Language Model=Vicuna-7B, Multi-dataset training=false2026.02 | 78.7 | — | — | — | — | |
| UniLSeg-100Vision Backbone=Swin-B2023.12 | 78.29 | — | — | — | — | |
| Text4Seg-7BPublication=ICLR 2025, Vision Model=SAM-H, Language Model=Vicuna-7B, Multi-dataset training=false2026.02 | 77.6 | — | — | — | — | |
| UniLSeg-20Vision Backbone=Swin-B2023.12 | 77.02 | — | — | — | — | |
| SAM4MLLM-7BPublication=ECCV 2024, Vision Model=SAM-XL, Language Model=Qwen-VL-7B, Multi-dataset training=false2026.02 | 75.9 | — | — | — | — | |
| VIPAPublication=-, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 75.22 | 77.58 | — | — | — | |
| UniNextVision Backbone=ConvNext-L2023.12 | 74.91 | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.02 | 74.56 | 75.71 | — | — | — | |
| UniRef-LVisual Backbone=Swin-L, Text Encoder=ROBERTa-base2023.12 | 74.11 | 78.3 | — | — | — | |
| UniRef++-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 73.98 | 78.04 | — | — | — | |
| MagNetPublication=CVPR 2024, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 73.64 | — | — | — | — | |
| SegLLMPublication=ICLR 2025, Vision Model=SAM-H, Language Model=Vicuna-7B, Multi-dataset training=false2026.02 | 73 | — | — | — | — | |
| PolyFormer-BVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 72.89 | 74.51 | — | — | — | |
| PolyFormerVision Backbone=Swin-B2023.12 | 72.89 | — | — | — | — | |
| PolyFormer-BPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 72.89 | 74.51 | — | — | — | |
| VIPAPublication=-, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 72.44 | 74.64 | — | — | — | |
| LQMFormerPublication=CVPR 2024, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 71.84 | — | — | — | — | |
| PixelLMPublication=CVPR 2024, Vision Model=CLIP-VIT-L, Language Model=Vicuna-7B, Multi-dataset training=false2026.02 | 71.7 | — | — | — | — | |
| GSVA-13BVisual Encoder=SAM-H + CLIP-L, Textual Encoder=Vicuna-13B2025.07 | 71.5 | — | — | — | — | |
| MagNetPublication=CVPR 2024, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 71.32 | — | — | — | — | |
| GRESVision Backbone=Swin-B2023.12 | 71.02 | — | — | — | — | |
| ReLAPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 71.02 | — | — | — | — | |
| CGFormer2023.09 | 71 | 73.76 | — | — | — | |
| CGFormerPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 71 | 73.76 | — | — | — | |
| LISA-7BPublication=CVPR 2024, Vision Model=SAM-H, Language Model=Vicuna-7B, Multi-dataset training=false2026.02 | 70.8 | — | — | — | — | |
| DMMIPublication=ICCV 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 69.73 | — | — | — | — | |
| GSVA-7BPublication=CVPR 2024, Vision Model=SAM-H, Language Model=Vicuna-7B, Multi-dataset training=false2026.02 | 69.6 | — | — | — | — | |
| UniRef++-R50Visual Backbone=RN50, Text Encoder=BERT-base2023.12 | 68.68 | 74.93 | — | — | — | |
| VLTPublication=TPAMI 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 68.43 | — | — | — | — | |
| LAVTLanguage Model=BERT2021.12 | 68.38 | — | — | — | — | |
| LAVT2023.09 | 68.38 | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Text Encoder=BERT-base2023.12 | 68.38 | 70.97 | — | — | — | |
| LAVTVision Backbone=Swin-B2023.12 | 68.38 | — | — | — | — | |
| UniRef-R50Visual Backbone=RN50, Text Encoder=ROBERTa-base2023.12 | 68.12 | 73.64 | — | — | — | |
| CRISVision Backbone=ResNet1012023.12 | 68.08 | — | — | — | — | |
| CRISVision Backbone=ResNet502023.12 | 67.1 | — | — | — | — | |
| ReSTRVisual Backbone=ViT-B, Text Encoder=Transformer2023.02 | 60.44 | — | — | — | — | |
| ReSTR2023.09 | 60.44 | — | — | — | — | |
| ReSTRVisual Backbone=ViT-B, Text Encoder=Transformer2023.12 | 60.44 | — | — | — | — | |
| ResTRVision Backbone=ViT-B2023.12 | 60.44 | — | — | — | — | |
| VLTLanguage Model=Bi-GRU2021.12 | 59.2 | — | — | — | — | |
| VLTVision Backbone=DarkNet532023.12 | 59.2 | — | — | — | — | |
| LTSLanguage Model=Bi-GRU2021.12 | 58.32 | — | — | — | — | |
| LTSVisual Backbone=DN53, Text Encoder=Bi-GRU2023.02 | 58.32 | — | — | — | — | |
| LTSVisual Backbone=DN53, Text Encoder=Bi-GRU2023.12 | 58.32 | — | — | — | — | |
| LTSVision Backbone=DarkNet532023.12 | 58.32 | — | — | — | — | |
| BUSNetLanguage Model=Self-Att2021.12 | 56.87 | — | — | — | — | |
| BUSNetVisual Backbone=RN101, Text Encoder=Self-Att2023.02 | 56.87 | — | — | — | — | |
| BUSNet2023.09 | 56.87 | — | — | — | — | |
| BUSNetVision Backbone=ResNet1012023.12 | 56.87 | — | — | — | — | |
| CGANLanguage Model=Bi-GRU2021.12 | 55.51 | — | — | — | — | |
| CGANVisual Backbone=DN53, Text Encoder=Bi-GRU2023.02 | 55.51 | — | — | — | — | |
| CGANVision Backbone=DarkNet532023.12 | 55.51 | — | — | — | — | |
| EFNLanguage Model=Bi-GRU2021.12 | 55.24 | — | — | — | — | |
| EFNVisual Backbone=WRN101, Text Encoder=Bi-GRU2023.02 | 55.24 | — | — | — | — | |
| CEFNet2023.09 | 55.24 | — | — | — | — | |
| EFNVisual Backbone=WRN101, Text Encoder=Bi-GRU2023.12 | 55.24 | — | — | — | — | |
| EFNVision Backbone=ResNet1012023.12 | 55.24 | — | — | — | — | |
| MCNLanguage Model=Bi-GRU2021.12 | 54.99 | — | — | — | — | |
| MCNVisual Backbone=DN53, Text Encoder=Bi-GRU2023.02 | 54.99 | — | — | — | — | |
| MCNVisual Backbone=DN53, Text Encoder=Bi-GRU2023.12 | 54.99 | — | — | — | — | |
| MCNVision Backbone=DarkNet532023.12 | 54.99 | — | — | — | — | |
| CMPC+Language Model=LSTM2021.12 | 54.04 | — | — | — | — | |
| CMPC+Visual Backbone=RN101, Text Encoder=LSTM2023.02 | 54.04 | — | — | — | — | |
| CMPC+Visual Backbone=RN101, Text Encoder=LSTM2023.12 | 54.04 | — | — | — | — | |
| CMPC+Vision Backbone=ResNet1012023.12 | 54.04 | — | — | — | — | |
| CMPCLanguage Model=LSTM2021.12 | 53.44 | — | — | — | — | |
| CMPCVisual Backbone=RN101, Text Encoder=LSTM2023.02 | 53.44 | — | — | — | — | |
| CMPC2023.09 | 53.44 | — | — | — | — | |
| CMPCVisual Backbone=RN101, Text Encoder=LSTM2023.12 | 53.44 | — | — | — | — | |
| LSCMLanguage Model=LSTM2021.12 | 53.12 | — | — | — | — | |
| LSCMVisual Backbone=RN101, Text Encoder=LSTM2023.02 | 53.12 | — | — | — | — | |
| LSCM2023.09 | 53.12 | — | — | — | — | |
| LSCMVisual Backbone=RN101, Text Encoder=LSTM2023.12 | 53.12 | — | — | — | — | |
| LSCMVision Backbone=ResNet1012023.12 | 53.12 | — | — | — | — | |
| MAttNetLanguage Model=Bi-LSTM2021.12 | 52.39 | — | — | — | — | |
| MAttNet2023.09 | 52.39 | — | — | — | — | |
| STEPLanguage Model=Bi-LSTM2021.12 | 52.33 | — | — | — | — | |
| STEPVisual Backbone=RN101, Text Encoder=Bi-LSTM2023.02 | 52.33 | — | — | — | — | |
| STEPVisual Backbone=RN101, Text Encoder=Bi-LSTM2023.12 | 52.33 | — | — | — | — | |
| BRINetLanguage Model=LSTM2021.12 | 52.32 | — | — | — | — | |
| BRINetVisual Backbone=RN101, Text Encoder=LSTM2023.02 | 52.32 | — | — | — | — | |
| BRINetVisual Backbone=RN101, Text Encoder=LSTM2023.12 | 52.32 | — | — | — | — | |
| CMSALanguage Model=None2021.12 | 47.6 | — | — | — | — | |
| CMSA2023.09 | 47.6 | — | — | — | — | |
| CMSAVisual Backbone=RN101, Text Encoder=LSTM2023.12 | 47.6 | — | — | — | — | |
| DMNLanguage Model=SRU2021.12 | 44.22 | — | — | — | — | |
| RRNLanguage Model=LSTM2021.12 | 42.15 | — | — | — | — | |
| RRN2023.09 | 42.15 | — | — | — | — | |
| ALBEFSupervision=Weakly, Extra Pre-training Data=CC [48], SBU [44], COCO [34], VG [23]2024.04 | — | 22.07 | — | — | — | |
| ASGN2021.11 | — | — | — | 39.79 | — | |
| BCAMBackbone=ResNet101, DCRF=true2021.03 | — | — | — | 52.87 | — | |
| BCANBackbone=ResNet-101, DenseCRF=true2021.11 | — | — | — | 52.87 | — | |
| BRINet2021.11 | — | — | — | 52.32 | — | |
| BRINet2020.10 | — | — | — | 52.87 | — | |
| BRINetVisual Backbone=DeepLab-R101, Textual Encoder=LSTM2022.10 | — | — | — | 52.32 | — | |
| BUSNet2021.11 | — | — | — | 56.14 | — | |
| BUSNetVisual Backbone=DeepLab-R101, Textual Encoder=Self-Att2022.10 | — | — | — | 56.87 | — | |
| C3VGVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | — | 79.61 | — | — | — | |
| C³VGPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | — | 79.61 | — | — | — |