Referring Image Segmentation on RefCOCO (val)
85.72mIoUDeRIS-L
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DeRIS-LVisual Encoder=Swin-B, Textual Encoder=BEIT3-L2025.07 | 85.72 | — | — | — | — | — | — | — | — | — | — | |
| DeRIS-L (published)Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Reference (published protocol)2026.06 | 85.72 | — | — | — | — | — | — | — | — | — | — | |
| DeRIS-L (reproduced)Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Our evaluation pipeline2026.06 | 85.46 | — | — | — | — | — | — | — | — | — | — | |
| Venice-H1Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Our evaluation pipeline2026.06 | 85.46 | — | — | — | — | — | — | — | — | — | 0 | |
| HIPIEExternal Datasets=Object365 (30M) & COCO + RefCOCO(+/g)2024.04 | 82.6 | — | — | — | — | — | — | — | — | — | — | |
| UNINEXT-HExternal Datasets=Object365 (30M) & COCO + RefCOCO(+/g)2024.04 | 82.2 | — | — | — | — | — | — | — | — | — | — | |
| DeRIS-BVisual Encoder=Swin-S, Textual Encoder=BEIT3-B2025.07 | 81.99 | — | — | — | — | — | — | — | — | — | — | |
| DeRIS-BVisual Enc.=Swin-S, Text Enc.=BEiT3-B, Evaluation pipeline=Specialist Methods2026.06 | 81.99 | — | — | — | — | — | — | — | — | — | — | |
| UniRef-LVisual Backbone=Swin-L, Text Encoder=ROBERTa-base2023.12 | 81.9 | — | 79.79 | — | — | — | — | — | — | — | — | |
| UniRef++-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 81.84 | — | 79.13 | — | — | — | — | — | — | — | — | |
| VATEXBackbone=Swin-B, Training=Joint2024.04 | 81.53 | — | — | — | — | — | — | — | — | — | — | |
| VATEX_jointExternal Datasets=RefCOCO(+/g) (368K), Backbone=Swin-B2024.04 | 81.53 | — | — | — | — | — | — | — | — | — | — | |
| C3VGVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | 81.37 | — | — | — | — | — | — | — | — | — | — | |
| C³VGPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 81.37 | — | — | — | — | — | — | — | — | — | — | |
| C3VGVisual Enc.=BEiT3-B, Text Enc.=BEiT3-B, Evaluation pipeline=Specialist Methods2026.06 | 81.37 | — | — | — | — | — | — | — | — | — | — | |
| OneRef-LVisual Encoder=BEIT3-L, Textual Encoder=BEIT3-L2025.07 | 81.26 | — | — | — | — | — | — | — | — | — | — | |
| OneRef-LVisual Enc.=BEiT3-L, Text Enc.=BEiT3-L, Evaluation pipeline=Specialist Methods2026.06 | 81.26 | — | — | — | — | — | — | — | — | — | — | |
| PPCRMLLMs=LLaVA-7B2026.03 | 81.1 | — | 80.1 | — | — | — | — | — | — | — | — | |
| VIPAPublication=-, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 80.97 | — | 78.14 | — | — | — | — | — | — | — | — | |
| C³VG-oIoUPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 80.89 | — | — | — | — | — | — | — | — | — | — | |
| GLaMMMLLMs=LLaVA-7B2026.03 | 80.76 | — | 79.5 | — | — | — | — | — | — | — | — | |
| OneRefPublication=NeurIPS2024, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 79.83 | — | — | — | — | — | — | — | — | — | — | |
| SAM4MLLM-8BVisual Encoder=SAM-EfficientViT-XL1, Textual Encoder=Qwen-VL-7B2025.07 | 79.8 | — | — | — | — | — | — | — | — | — | — | |
| SegLLMMLLMs=LLaVA-7B2026.03 | 79.55 | — | 79.32 | — | — | — | — | — | — | — | — | |
| GLaMM-7BVisual Encoder=SAM-H + CLIP-H, Textual Encoder=Vicuna-7B2025.07 | 79.5 | — | — | — | — | — | — | — | — | — | — | |
| EEVGVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 79.49 | — | — | — | — | — | — | — | — | — | — | |
| EEVGPublication=ECCV2024, Backbone=ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 79.49 | — | — | — | — | — | — | — | — | — | — | |
| CMIRNetMLLMs=–2026.03 | 78.98 | — | 78.24 | — | — | — | — | — | — | — | — | |
| UniRef++-R50Visual Backbone=RN50, Text Encoder=BERT-base2023.12 | 78.97 | — | 75.63 | — | — | — | — | — | — | — | — | |
| VIPAPublication=-, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 78.68 | — | 75.84 | — | — | — | — | — | — | — | — | |
| EEVGPublication=ECCV 2024, Vision Model=ViT-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 78.23 | — | — | — | — | — | — | — | — | — | — | |
| HeROD-G2026.03 | 78.21 | — | — | — | — | — | — | — | — | — | — | |
| VATEX2024.04 | 78.17 | — | — | 88.12 | — | — | 82.54 | 45.11 | — | — | — | |
| VATEXBackbone=Swin-B2024.04 | 78.16 | — | — | — | — | — | — | — | — | — | — | |
| VATEXVisual Backbone=Swin-B, Textual Backbone=CLIP2024.04 | 78.16 | — | — | — | — | — | — | — | — | — | — | |
| VATEX_RefCOCOExternal Datasets=RefCOCO (142K), Backbone=Swin-B2024.04 | 78.16 | — | — | — | — | — | — | — | — | — | — | |
| UniRef-R50Visual Backbone=RN50, Text Encoder=ROBERTa-base2023.12 | 78.14 | — | 75.04 | — | — | — | — | — | — | — | — | |
| Prompt-RISVisual Encoder=SAM-B + CLIP-B, Textual Encoder=CLIP-B2025.07 | 78.1 | — | — | — | — | — | — | — | — | — | — | |
| Prompt-RISPublication=CVPR2024, Backbone=CLIP-VIT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 78.1 | — | — | — | — | — | — | — | — | — | — | |
| AMLTraining Strategy=Standard2026.02 | 77.89 | — | 75.45 | — | — | — | — | — | — | — | — | |
| TALENTPET=true2026.04 | 77.8 | — | 75.9 | — | — | — | — | — | — | — | — | |
| SimVG-SegVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | 77.78 | — | — | — | — | — | — | — | — | — | — | |
| SimVG-SegVisual Enc.=BEiT3-B, Text Enc.=BEiT3-B, Evaluation pipeline=Specialist Methods2026.06 | 77.78 | — | — | — | — | — | — | — | — | — | — | |
| MagNetTraining Strategy=Standard2026.02 | 77.43 | — | 75.24 | — | — | — | — | — | — | — | — | |
| GSVAPublication=CVPR2024, Backbone=Vicuna-7B, Fine-tuned=false2025.01 | 77.2 | — | — | — | — | — | — | — | — | — | — | |
| GSVA-7BBackbone=ViT-H2025.12 | 77.2 | — | — | — | — | — | — | — | — | — | — | |
| PolyFormer-LVisual Encoder=Swin-L, Textual Encoder=BERT-B2025.07 | 76.94 | — | — | — | — | — | — | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.02 | 76.94 | — | 75.96 | — | — | — | — | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 76.94 | — | — | — | — | — | — | — | — | — | — | |
| CGFormerVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 76.93 | — | — | — | — | — | — | — | — | — | — | |
| CGFormer2023.09 | 76.93 | — | 74.75 | — | — | — | — | — | — | — | — | |
| CG-Former2024.04 | 76.93 | — | — | 87.23 | — | — | 78.69 | 38.77 | — | — | — | |
| CGFormerPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 76.93 | — | 74.75 | — | — | — | — | — | — | — | — | |
| CGFormerTraining Strategy=Standard2026.02 | 76.93 | — | 74.75 | — | — | — | — | — | — | — | — | |
| SAMWISEText Encoder=RoBERTa2024.11 | 76.8 | — | — | — | — | — | — | — | — | — | — | |
| CARIS*Training Strategy=Standard2026.02 | 76.77 | — | 74.65 | — | — | — | — | — | — | — | — | |
| PGBDTraining Strategy=Standard2026.02 | 76.45 | — | 74.43 | — | — | — | — | — | — | — | — | |
| DETRIS-BPublication=AAAI 2025, Vision Model=DINOv2-B, Language Model=CLIP, Multi-dataset training=false2026.02 | 76 | — | — | — | — | — | — | — | — | — | — | |
| DETRISPET=true2026.04 | 76 | — | — | — | — | — | — | — | — | — | — | |
| PolyFormer-BVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 75.96 | — | 74.82 | — | — | — | — | — | — | — | — | |
| PolyFormer-BExternal Datasets=RefCOCO(+/g) (368K)2024.04 | 75.96 | — | — | — | — | — | — | — | — | — | — | |
| PolyFormerPublication=CVPR2023, Backbone=Swin-B, Data=Com-RefC, Fine-tuned=true2025.01 | 75.96 | — | — | — | — | — | — | — | — | — | — | |
| PolyFormer-BPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 75.96 | — | 74.82 | — | — | — | — | — | — | — | — | |
| RISCLIPPET=true2026.04 | 75.7 | — | 73.6 | — | — | — | — | — | — | — | — | |
| DETRIS*Training Strategy=Standard2026.02 | 75.64 | — | 74.05 | — | — | — | — | — | — | — | — | |
| VG-LAWVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 75.62 | — | — | — | — | — | — | — | — | — | — | |
| ReLA2024.04 | 75.61 | — | — | 85.92 | — | — | 77.71 | 34.99 | — | — | — | |
| OMG-LLAVAType=SAM2025.10 | 75.6 | — | — | — | — | — | — | — | — | — | — | |
| CoupAlignMLLMs=–2026.03 | 75.49 | — | 74.7 | — | — | — | — | — | — | — | — | |
| MagNetText Encoder=BERT, Group=RIS Specialist2024.11 | 75.2 | — | — | — | — | — | — | — | — | — | — | |
| VG-LAWVisual Backbone=ViT-B, Textual Backbone=BERT2024.04 | 75.05 | — | — | — | — | — | — | — | — | — | — | |
| LISA-7B+Visual Encoder=SAM-H + CLIP-L, Textual Encoder=Vicuna-7B2025.07 | 74.9 | — | — | — | — | — | — | — | — | — | — | |
| LISAPublication=CVPR2024, Backbone=Vicuna-7B, Fine-tuned=false2025.01 | 74.9 | — | — | — | — | — | — | — | — | — | — | |
| LISA-7BBackbone=ViT-H2025.12 | 74.9 | — | — | — | — | — | — | — | — | — | — | |
| PVDVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 74.82 | — | — | — | — | — | — | — | — | — | — | |
| PVDPublication=AAAI2024, Backbone=Swin-B, Data=Com-RefC, Fine-tuned=true2025.01 | 74.82 | — | — | — | — | — | — | — | — | — | — | |
| PolyFormer-BType=Vision2025.10 | 74.8 | — | — | — | — | — | — | — | — | — | — | |
| LAVTMLLMs=–2026.03 | 74.76 | — | 72.73 | — | — | — | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 74.46 | — | — | — | — | — | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Text Encoder=BERT-base2023.12 | 74.46 | — | 72.73 | — | — | — | — | — | — | — | — | |
| LAVT2024.04 | 74.46 | — | — | 84.46 | — | — | 75.28 | 34.3 | — | — | — | |
| LAVTVisual Backbone=Swin-B, Textual Backbone=BERT2024.04 | 74.46 | — | — | — | — | — | — | — | — | — | — | |
| LAVTPublication=CVPR2022, Backbone=Swin-B, Data=RefC, Fine-tuned=false2025.01 | 74.46 | — | — | — | — | — | — | — | — | — | — | |
| LAVTTraining Strategy=Standard2026.02 | 74.46 | — | 72.73 | — | — | — | — | — | — | — | — | |
| LAVTVisual Enc.=Swin-B, Text Enc.=BERT-B, Evaluation pipeline=Specialist Methods2026.06 | 74.46 | — | — | — | — | — | — | — | — | — | — | |
| RefTrVisual Backbone=RN101, Text Encoder=BERT-base2023.02 | 74.34 | — | — | — | — | — | — | — | — | — | — | |
| RefTrVisual Backbone=RN101, Text Encoder=BERT-base2023.12 | 74.34 | — | — | — | — | — | — | — | — | — | — | |
| RefTRExternal Datasets=Visual Genome (5.4M) & Flickr30k-entities (158K)2024.04 | 74.34 | — | — | — | — | — | — | — | — | — | — | |
| LQMFormerBackbone=Swin-B2025.12 | 74.16 | — | — | — | — | — | — | — | — | — | — | |
| LISA-7BVisual Backbone=ViT-H SAM, Textual Backbone=Vicuna-7B2024.04 | 74.1 | — | — | — | — | — | — | — | — | — | — | |
| LISA-7BType=SAM2025.10 | 74.1 | — | — | — | — | — | — | — | — | — | — | |
| OmniSegNetBackbone=Swin-B2025.12 | 74.02 | — | — | — | — | — | — | — | — | — | — | |
| ReLAPublication=CVPR2023, Backbone=Swin-B, Data=RefC, Fine-tuned=false2025.01 | 73.82 | — | — | — | — | — | — | — | — | — | — | |
| ReLABackbone=Swin-B2025.12 | 73.82 | — | — | — | — | — | — | — | — | — | — | |
| ETOGPET=true2026.04 | 73.4 | — | 71.4 | — | — | — | — | — | — | — | — | |
| PixelLM-7BBackbone=CLIP-ViT-L2025.12 | 73 | — | — | — | — | — | — | — | — | — | — | |
| PixelLM-7BType=SAM2025.10 | 73 | — | — | — | — | — | — | — | — | — | — | |
| VLTVisual Backbone=Swin-B, Textual Backbone=BERT2024.04 | 72.96 | — | — | — | — | — | — | — | — | — | — | |
| VLTVisual Backbone=Swin-B, Textual Encoder=BERT2022.10 | 72.96 | — | — | 85.35 | — | — | — | — | — | — | — | |
| LAVTBackbone=Swin-B2025.12 | 72.73 | — | — | — | — | — | — | — | — | — | — |