Referring Image Segmentation on RefCOCO+ (val)
81.28mIoUDeRIS-L
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| DeRIS-LVisual Encoder=Swin-B, Textual Encoder=BEIT3-L2025.07 | 81.28 | — | — | — | — | — | — | — | |
| DeRIS-L (published)Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Reference (published protocol)2026.06 | 81.28 | — | — | — | — | — | — | — | |
| DeRIS-L (reproduced)Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Our evaluation pipeline2026.06 | 81.12 | — | — | — | — | — | — | — | |
| Venice-H1Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Our evaluation pipeline2026.06 | 81.12 | — | — | — | — | — | — | 0 | |
| C3VGVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | 77.05 | — | — | — | — | — | — | — | |
| C³VGPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 77.05 | — | — | — | — | — | — | — | |
| C3VGVisual Enc.=BEiT3-B, Text Enc.=BEiT3-B2026.06 | 77.05 | — | — | — | — | — | — | — | |
| OneRef-LVisual Encoder=BEIT3-L, Textual Encoder=BEIT3-L2025.07 | 76.6 | — | — | — | — | — | — | — | |
| OneRef-LVisual Enc.=BEiT3-L, Text Enc.=BEiT3-L2026.06 | 76.6 | — | — | — | — | — | — | — | |
| DeRIS-BVisual Encoder=Swin-S, Textual Encoder=BEIT3-B2025.07 | 75.62 | — | — | — | — | — | — | — | |
| DeRIS-BVisual Enc.=Swin-S, Text Enc.=BEiT3-B2026.06 | 75.62 | — | — | — | — | — | — | — | |
| OneRefPublication=NeurIPS2024, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 74.68 | — | — | — | — | — | — | — | |
| C³VG-oIoUPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 74.68 | — | — | — | — | — | — | — | |
| VATEXBackbone=Swin-B, Training=Joint2024.04 | 74.61 | — | — | — | — | — | — | — | |
| VATEX_jointExternal Datasets=RefCOCO(+/g) (368K), Backbone=Swin-B2024.04 | 74.61 | — | — | — | — | — | — | — | |
| SAM4MLLM-8BVisual Encoder=SAM-EfficientViT-XL1, Textual Encoder=Qwen-VL-7B2025.07 | 74.6 | — | — | — | — | — | — | — | |
| PPCRMLLMs=LLaVA-7B2026.03 | 74.34 | — | 72.5 | — | — | — | — | — | |
| UniRef++-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 74.02 | — | 68.43 | — | — | — | — | — | |
| UniRef-LVisual Backbone=Swin-L, Text Encoder=ROBERTa-base2023.12 | 73.81 | — | 69.26 | — | — | — | — | — | |
| GLaMMMLLMs=LLaVA-7B2026.03 | 73.76 | — | 72.1 | — | — | — | — | — | |
| SegLLMMLLMs=LLaVA-7B2026.03 | 73.7 | — | 70.78 | — | — | — | — | — | |
| VIPAPublication=-, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 73.69 | — | 70.15 | — | — | — | — | — | |
| OracleBackbone=ResNet-50, Segmentor=true2024.10 | 73.1 | — | — | — | — | — | — | — | |
| HIPIEExternal Datasets=Object365 (30M) & COCO + RefCOCO(+/g)2024.04 | 73 | — | — | — | — | — | — | — | |
| GLaMM-7BVisual Encoder=SAM-H + CLIP-H, Textual Encoder=Vicuna-7B2025.07 | 72.6 | — | — | — | — | — | — | — | |
| UNINEXT-HExternal Datasets=Object365 (30M) & COCO + RefCOCO(+/g)2024.04 | 72.5 | — | — | — | — | — | — | — | |
| CMIRNetMLLMs=–2026.03 | 72.5 | — | 69.82 | — | — | — | — | — | |
| SimVG-SegVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | 72.21 | — | — | — | — | — | — | — | |
| SimVG-SegVisual Enc.=BEiT3-B, Text Enc.=BEiT3-B2026.06 | 72.21 | — | — | — | — | — | — | — | |
| PolyFormer-LVisual Encoder=Swin-L, Textual Encoder=BERT-B2025.07 | 72.15 | — | — | — | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.02 | 72.15 | — | 69.33 | — | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 72.15 | — | — | — | — | — | — | — | |
| EEVGVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 71.86 | — | — | — | — | — | — | — | |
| EEVGPublication=ECCV2024, Backbone=ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 71.86 | — | — | — | — | — | — | — | |
| HeROD-G2026.03 | 71.52 | — | — | — | — | — | — | — | |
| AMLTraining Strategy=Standard2026.02 | 71.33 | — | 67.37 | — | — | — | — | — | |
| Prompt-RISVisual Encoder=SAM-B + CLIP-B, Textual Encoder=CLIP-B2025.07 | 71.13 | — | — | — | — | — | — | — | |
| Prompt-RISPublication=CVPR2024, Backbone=CLIP-VIT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 71.13 | — | — | — | — | — | — | — | |
| PolyFormer-BVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 70.65 | — | 67.64 | — | — | — | — | — | |
| PolyFormer-BExternal Datasets=RefCOCO(+/g) (368K)2024.04 | 70.65 | — | — | — | — | — | — | — | |
| PolyFormerPublication=CVPR2023, Backbone=Swin-B, Data=Com-RefC, Fine-tuned=true2025.01 | 70.65 | — | — | — | — | — | — | — | |
| PolyFormer-BPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 70.65 | — | 67.64 | — | — | — | — | — | |
| VIPAPublication=-, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 70.42 | — | 66.91 | — | — | — | — | — | |
| MagNetTraining Strategy=Standard2026.02 | 70.1 | — | 66.16 | — | — | — | — | — | |
| TALENTPET=true2026.04 | 70.1 | — | 66.9 | — | — | — | — | — | |
| VATEXBackbone=Swin-B2024.04 | 70.02 | — | — | — | — | — | — | — | |
| VATEXVisual Backbone=Swin-B, Textual Backbone=CLIP2024.04 | 70.02 | — | — | — | — | — | — | — | |
| VATEX_RefCOCO+External Datasets=RefCOCO+ (141K), Backbone=Swin-B2024.04 | 70.02 | — | — | — | — | — | — | — | |
| UniRef++-R50Visual Backbone=RN50, Text Encoder=BERT-base2023.12 | 69.53 | — | 63.29 | — | — | — | — | — | |
| CARIS*Training Strategy=Standard2026.02 | 69.33 | — | 65.54 | — | — | — | — | — | |
| RISCLIPPET=true2026.04 | 69.2 | — | 65.5 | — | — | — | — | — | |
| UniRef-R50Visual Backbone=RN50, Text Encoder=ROBERTa-base2023.12 | 69.09 | — | 63.25 | — | — | — | — | — | |
| EEVGPublication=ECCV 2024, Vision Model=ViT-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 69.04 | — | — | — | — | — | — | — | |
| DETRIS-BPublication=AAAI 2025, Vision Model=DINOv2-B, Language Model=CLIP, Multi-dataset training=false2026.02 | 68.9 | — | — | — | — | — | — | — | |
| DETRISPET=true2026.04 | 68.9 | — | — | — | — | — | — | — | |
| PGBDTraining Strategy=Standard2026.02 | 68.82 | — | 65.27 | — | — | — | — | — | |
| CGFormerVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 68.56 | — | — | — | — | — | — | — | |
| CGFormer2023.09 | 68.56 | — | 64.54 | — | — | — | — | — | |
| CGFormerPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 68.56 | — | 64.54 | — | — | — | — | — | |
| CGFormerTraining Strategy=Standard2026.02 | 68.56 | — | 64.54 | — | — | — | — | — | |
| DETRIS*Training Strategy=Standard2026.02 | 68.47 | — | 65.39 | — | — | — | — | — | |
| PolyFormer-BType=Vision2025.10 | 67.6 | — | — | — | — | — | — | — | |
| SAMWISEText Encoder=RoBERTa2024.11 | 67.1 | — | — | — | — | — | — | — | |
| RefTrVisual Backbone=RN101, Text Encoder=BERT-base2023.02 | 66.75 | — | — | — | — | — | — | — | |
| RefTrVisual Backbone=RN101, Text Encoder=BERT-base2023.12 | 66.75 | — | — | — | — | — | — | — | |
| RefTRExternal Datasets=Visual Genome (5.4M) & Flickr30k-entities (158K)2024.04 | 66.75 | — | — | — | — | — | — | — | |
| VG-LAWVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 66.63 | — | — | — | — | — | — | — | |
| VG-LAWVisual Backbone=ViT-B, Textual Backbone=BERT2024.04 | 66.61 | — | — | — | — | — | — | — | |
| PixelLM-7BBackbone=CLIP-ViT-L2025.12 | 66.3 | — | — | — | — | — | — | — | |
| PixelLM-7BType=SAM2025.10 | 66.3 | — | — | — | — | — | — | — | |
| MagNetText Encoder=BERT, Group=RIS Specialist2024.11 | 66.2 | — | — | — | — | — | — | — | |
| CoupAlignMLLMs=–2026.03 | 66.17 | — | 62.92 | — | — | — | — | — | |
| ReLAPublication=CVPR2023, Backbone=Swin-B, Data=RefC, Fine-tuned=false2025.01 | 66.04 | — | — | — | — | — | — | — | |
| ReLABackbone=Swin-B2025.12 | 66.04 | — | — | — | — | — | — | — | |
| ETOGPET=true2026.04 | 66 | — | 62.3 | — | — | — | — | — | |
| OmniSegNetBackbone=Swin-B2025.12 | 65.95 | — | — | — | — | — | — | — | |
| LQMFormerBackbone=Swin-B2025.12 | 65.91 | — | — | — | — | — | — | — | |
| GSVAPublication=CVPR2024, Backbone=Vicuna-7B, Fine-tuned=false2025.01 | 65.9 | — | — | — | — | — | — | — | |
| GSVA-7BBackbone=ViT-H2025.12 | 65.9 | — | — | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 65.81 | — | — | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Text Encoder=BERT-base2023.12 | 65.81 | — | 62.14 | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Textual Backbone=BERT2024.04 | 65.81 | — | — | — | — | — | — | — | |
| LAVTPublication=CVPR2022, Backbone=Swin-B, Data=RefC, Fine-tuned=false2025.01 | 65.81 | — | — | — | — | — | — | — | |
| LAVTTraining Strategy=Standard2026.02 | 65.81 | — | 62.14 | — | — | — | — | — | |
| LAVTMLLMs=–2026.03 | 65.81 | — | 62.14 | — | — | — | — | — | |
| LAVTVisual Enc.=Swin-B, Text Enc.=BERT-B2026.06 | 65.81 | — | — | — | — | — | — | — | |
| LAVT+Backbone=Swin-Base2024.10 | 65.8 | — | — | — | — | — | — | — | |
| OMG-LLAVAType=SAM2025.10 | 65.6 | — | — | — | — | — | — | — | |
| Ming-Flash-OmniType=Uni2025.10 | 65.2 | — | — | — | — | — | — | — | |
| LISA-7B+Visual Encoder=SAM-H + CLIP-L, Textual Encoder=Vicuna-7B2025.07 | 65.1 | — | — | — | — | — | — | — | |
| LISA-7BVisual Backbone=ViT-H SAM, Textual Backbone=Vicuna-7B2024.04 | 65.1 | — | — | — | — | — | — | — | |
| LISAPublication=CVPR2024, Backbone=Vicuna-7B, Fine-tuned=false2025.01 | 65.1 | — | — | — | — | — | — | — | |
| LISA-7BBackbone=ViT-H2025.12 | 65.1 | — | — | — | — | — | — | — | |
| BarLeRIaTraining Strategy=Standard2026.02 | 65 | — | — | — | — | — | — | — | |
| BarLeRIaPET=true2026.04 | 65 | — | — | — | — | — | — | — | |
| CM-MaskSDVisual Backbone=CLIP-ViT-B, Textual Backbone=CLIP2024.04 | 64.47 | — | — | — | — | — | — | — | |
| VLTVisual Backbone=Swin-B, Textual Backbone=BERT2024.04 | 63.53 | — | — | — | — | — | — | — | |
| PVDVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 63.38 | — | — | — | — | — | — | — | |
| PVDPublication=AAAI2024, Backbone=Swin-B, Data=Com-RefC, Fine-tuned=true2025.01 | 63.38 | — | — | — | — | — | — | — | |
| SeqTRVisual Backbone=DN53, Text Encoder=Bi-GRU2023.02 | 63.04 | — | — | — | — | — | — | — |