Referring Image Segmentation on RefCOCO (test B)
84.57mIoUDeRIS-L (reproduced)
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| DeRIS-L (reproduced)Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Our evaluation pipeline2026.06 | 84.57 | — | — | — | — | — | — | — | — | — | |
| Venice-H1Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Our evaluation pipeline2026.06 | 84.57 | — | — | — | — | — | — | — | — | 0 | |
| DeRIS-LVisual Encoder=Swin-B, Textual Encoder=BEIT3-L2025.07 | 84.52 | — | — | — | — | — | — | — | — | — | |
| DeRIS-L (published)Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Reference (published protocol)2026.06 | 84.52 | — | — | — | — | — | — | — | — | — | |
| UniRef++-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 80.44 | — | 77.45 | — | — | — | — | — | — | — | |
| DeRIS-BVisual Encoder=Swin-S, Textual Encoder=BEIT3-B2025.07 | 80.14 | — | — | — | — | — | — | — | — | — | |
| DeRIS-BVisual Enc.=Swin-S, Text Enc.=BEiT3-B2026.06 | 80.14 | — | — | — | — | — | — | — | — | — | |
| VATEX_jointExternal Datasets=RefCOCO(+/g) (368K), Backbone=Swin-B2024.04 | 79.66 | — | — | — | — | — | — | — | — | — | |
| UniRef-LVisual Backbone=Swin-L, Text Encoder=ROBERTa-base2023.12 | 79.61 | — | 77.02 | — | — | — | — | — | — | — | |
| OneRef-LVisual Encoder=BEIT3-L, Textual Encoder=BEIT3-L2025.07 | 79.45 | — | — | — | — | — | — | — | — | — | |
| OneRef-LVisual Enc.=BEiT3-L, Text Enc.=BEiT3-L2026.06 | 79.45 | — | — | — | — | — | — | — | — | — | |
| C³VGPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 79.13 | — | — | — | — | — | — | — | — | — | |
| C3VGVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | 79.12 | — | — | — | — | — | — | — | — | — | |
| C3VGVisual Enc.=BEiT3-B, Text Enc.=BEiT3-B2026.06 | 79.12 | — | — | — | — | — | — | — | — | — | |
| VIPAPublication=-, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 78.53 | — | 75.24 | — | — | — | — | — | — | — | |
| GLaMMMLLMs=LLaVA-7B2026.03 | 78.36 | — | 76.9 | — | — | — | — | — | — | — | |
| PPCRMLLMs=LLaVA-7B2026.03 | 78.33 | — | 77.6 | — | — | — | — | — | — | — | |
| SegLLMMLLMs=LLaVA-7B2026.03 | 78.12 | — | 76.58 | — | — | — | — | — | — | — | |
| C³VG-oIoUPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 77.86 | — | — | — | — | — | — | — | — | — | |
| EEVGVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 77.39 | — | — | — | — | — | — | — | — | — | |
| EEVGPublication=ECCV2024, Backbone=ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 77.39 | — | — | — | — | — | — | — | — | — | |
| OneRefPublication=NeurIPS2024, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 76.99 | — | — | — | — | — | — | — | — | — | |
| GLaMM-7BVisual Encoder=SAM-H + CLIP-H, Textual Encoder=Vicuna-7B2025.07 | 76.9 | — | — | — | — | — | — | — | — | — | |
| EEVGPublication=ECCV 2024, Vision Model=ViT-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 76.58 | — | — | — | — | — | — | — | — | — | |
| CMIRNetMLLMs=–2026.03 | 76.56 | — | 75.22 | — | — | — | — | — | — | — | |
| UniRef++-R50Visual Backbone=RN50, Text Encoder=BERT-base2023.12 | 76.51 | — | 72.91 | — | — | — | — | — | — | — | |
| SimVG-SegVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | 76.02 | — | — | — | — | — | — | — | — | — | |
| SimVG-SegVisual Enc.=BEiT3-B, Text Enc.=BEiT3-B2026.06 | 76.02 | — | — | — | — | — | — | — | — | — | |
| VIPAPublication=-, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 75.98 | — | 72.2 | — | — | — | — | — | — | — | |
| UniRef-R50Visual Backbone=RN50, Text Encoder=ROBERTa-base2023.12 | 75.94 | — | 72.43 | — | — | — | — | — | — | — | |
| VATEXVisual Backbone=Swin-B, Textual Backbone=CLIP2024.04 | 75.64 | — | — | — | — | — | — | — | — | — | |
| VATEX_RefCOCOExternal Datasets=RefCOCO (142K), Backbone=Swin-B2024.04 | 75.64 | — | — | — | — | — | — | — | — | — | |
| AMLTraining Strategy=Standard2026.02 | 74.99 | — | 72.12 | — | — | — | — | — | — | — | |
| PolyFormer-LVisual Encoder=Swin-L, Textual Encoder=BERT-B2025.07 | 74.83 | — | — | — | — | — | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.02 | 74.83 | — | 73.25 | — | — | — | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 74.83 | — | — | — | — | — | — | — | — | — | |
| TALENTPET=true2026.04 | 74.8 | — | 72.8 | — | — | — | — | — | — | — | |
| SAM4MLLM-8BVisual Encoder=SAM-EfficientViT-XL1, Textual Encoder=Qwen-VL-7B2025.07 | 74.7 | — | — | — | — | — | — | — | — | — | |
| Prompt-RISVisual Encoder=SAM-B + CLIP-B, Textual Encoder=CLIP-B2025.07 | 74.64 | — | — | — | — | — | — | — | — | — | |
| Prompt-RISPublication=CVPR2024, Backbone=CLIP-VIT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 74.64 | — | — | — | — | — | — | — | — | — | |
| CARIS*Training Strategy=Standard2026.02 | 74.56 | — | 71.7 | — | — | — | — | — | — | — | |
| HeROD-G2026.03 | 74.3 | — | — | — | — | — | — | — | — | — | |
| MagNetTraining Strategy=Standard2026.02 | 74.11 | — | 71.05 | — | — | — | — | — | — | — | |
| GSVAPublication=CVPR2024, Backbone=Vicuna-7B, Fine-tuned=false2025.01 | 73.5 | — | — | — | — | — | — | — | — | — | |
| GSVA-7BBackbone=ViT-H2025.12 | 73.5 | — | — | — | — | — | — | — | — | — | |
| DETRIS-BPublication=AAAI 2025, Vision Model=DINOv2-B, Language Model=CLIP, Multi-dataset training=false2026.02 | 73.5 | — | — | — | — | — | — | — | — | — | |
| DETRISPET=true2026.04 | 73.5 | — | — | — | — | — | — | — | — | — | |
| CGFormerVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 73.32 | — | — | — | — | — | — | — | — | — | |
| CGFormer2023.09 | 73.32 | — | 70.64 | — | — | — | — | — | — | — | |
| CGFormerPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 73.32 | — | 70.64 | — | — | — | — | — | — | — | |
| CGFormerTraining Strategy=Standard2026.02 | 73.32 | — | 70.64 | — | — | — | — | — | — | — | |
| PolyFormer-BVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 73.22 | — | 71.06 | — | — | — | — | — | — | — | |
| PolyFormer-BExternal Datasets=RefCOCO(+/g) (368K)2024.04 | 73.22 | — | — | — | — | — | — | — | — | — | |
| PolyFormerPublication=CVPR2023, Backbone=Swin-B, Data=Com-RefC, Fine-tuned=true2025.01 | 73.22 | — | — | — | — | — | — | — | — | — | |
| PolyFormer-BPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 73.22 | — | 71.06 | — | — | — | — | — | — | — | |
| PGBDTraining Strategy=Standard2026.02 | 73.14 | — | 70.91 | — | — | — | — | — | — | — | |
| DETRIS*Training Strategy=Standard2026.02 | 73.11 | — | 71.33 | — | — | — | — | — | — | — | |
| VG-LAWVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 72.89 | — | — | — | — | — | — | — | — | — | |
| RISCLIPPET=true2026.04 | 72.5 | — | 69.8 | — | — | — | — | — | — | — | |
| LISA-7B+Visual Encoder=SAM-H + CLIP-L, Textual Encoder=Vicuna-7B2025.07 | 72.3 | — | — | — | — | — | — | — | — | — | |
| LISAPublication=CVPR2024, Backbone=Vicuna-7B, Fine-tuned=false2025.01 | 72.3 | — | — | — | — | — | — | — | — | — | |
| LISA-7BBackbone=ViT-H2025.12 | 72.3 | — | — | — | — | — | — | — | — | — | |
| VG-LAWVisual Backbone=ViT-B, Textual Backbone=BERT2024.04 | 71.69 | — | — | — | — | — | — | — | — | — | |
| LISA-7BVisual Backbone=ViT-H SAM, Textual Backbone=Vicuna-7B2024.04 | 71.1 | — | — | — | — | — | — | — | — | — | |
| LQMFormerBackbone=Swin-B2025.12 | 71.04 | — | — | — | — | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 70.94 | — | — | — | — | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Text Encoder=BERT-base2023.12 | 70.94 | — | 68.79 | — | — | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Textual Backbone=BERT2024.04 | 70.94 | — | — | — | — | — | — | — | — | — | |
| LAVTPublication=CVPR2022, Backbone=Swin-B, Data=RefC, Fine-tuned=false2025.01 | 70.94 | — | — | — | — | — | — | — | — | — | |
| LAVTTraining Strategy=Standard2026.02 | 70.94 | — | 68.79 | — | — | — | — | — | — | — | |
| LAVTMLLMs=–2026.03 | 70.94 | — | 68.79 | — | — | — | — | — | — | — | |
| LAVTVisual Enc.=Swin-B, Text Enc.=BERT-B2026.06 | 70.94 | — | — | — | — | — | — | — | — | — | |
| RefTrVisual Backbone=RN101, Text Encoder=BERT-base2023.02 | 70.87 | — | — | — | — | — | — | — | — | — | |
| RefTrVisual Backbone=RN101, Text Encoder=BERT-base2023.12 | 70.87 | — | — | — | — | — | — | — | — | — | |
| RefTRExternal Datasets=Visual Genome (5.4M) & Flickr30k-entities (158K)2024.04 | 70.87 | — | — | — | — | — | — | — | — | — | |
| OmniSegNetBackbone=Swin-B2025.12 | 70.63 | — | — | — | — | — | — | — | — | — | |
| ReLAPublication=CVPR2023, Backbone=Swin-B, Data=RefC, Fine-tuned=false2025.01 | 70.18 | — | — | — | — | — | — | — | — | — | |
| ReLABackbone=Swin-B2025.12 | 70.18 | — | — | — | — | — | — | — | — | — | |
| SeqTRVisual Backbone=DN53, Text Encoder=Bi-GRU2023.02 | 69.82 | — | — | — | — | — | — | — | — | — | |
| SeqTRVisual Backbone=DN53, Text Encoder=Bi-GRU2023.12 | 69.82 | — | — | — | — | — | — | — | — | — | |
| SeqTRExternal Datasets=Visual Genome (5.4M) & Flickr30k-entities (158K)2024.04 | 69.82 | — | — | — | — | — | — | — | — | — | |
| SeqTRPublication=ECCV2022, Backbone=DarkNet53, Data=Com-RefC, Fine-tuned=true2025.01 | 69.82 | — | — | — | — | — | — | — | — | — | |
| VLTVisual Backbone=Swin-B, Textual Backbone=BERT2024.04 | 69.6 | — | — | — | — | — | — | — | — | — | |
| PVDVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 69.52 | — | — | — | — | — | — | — | — | — | |
| PVDPublication=AAAI2024, Backbone=Swin-B, Data=Com-RefC, Fine-tuned=true2025.01 | 69.52 | — | — | — | — | — | — | — | — | — | |
| ETOGPET=true2026.04 | 69.3 | — | 66.7 | — | — | — | — | — | — | — | |
| LAVTBackbone=Swin-B2025.12 | 68.79 | — | — | — | — | — | — | — | — | — | |
| DITBackbone=ViT-B2025.12 | 68.77 | — | — | — | — | — | — | — | — | — | |
| LAVT+Backbone=Swin-Base2024.10 | 68.7 | — | — | — | — | — | — | — | — | — | |
| BarLeRIaTraining Strategy=Standard2026.02 | 68.3 | — | — | — | — | — | — | — | — | — | |
| BarLeRIaPET=true2026.04 | 68.3 | — | — | — | — | — | — | — | — | — | |
| PixelLM-7BBackbone=CLIP-ViT-L2025.12 | 68.2 | — | — | — | — | — | — | — | — | — | |
| CM-MaskSDVisual Backbone=CLIP-ViT-B, Textual Backbone=CLIP2024.04 | 67.91 | — | — | — | — | — | — | — | — | — | |
| OracleBackbone=ResNet-50, Segmentor=true2024.10 | 67.7 | — | — | — | — | — | — | — | — | — | |
| ETRISTraining Strategy=Standard2026.02 | 66.66 | — | — | — | — | — | — | — | — | — | |
| ETRISPET=true2026.04 | 66.6 | — | — | — | — | — | — | — | — | — | |
| CRISVisual Backbone=RN101, Text Encoder=GPT-22023.02 | 66.1 | — | — | — | — | — | — | — | — | — | |
| CRISVisual Backbone=RN101, Text Encoder=GPT-22023.12 | 66.1 | — | — | — | — | — | — | — | — | — | |
| CRISVisual Backbone=ResNet-101, Textual Backbone=CLIP2024.04 | 66.1 | — | — | — | — | — | — | — | — | — | |
| CRISPublication=CVPR2022, Backbone=ResNet101, Data=RefC, Fine-tuned=false2025.01 | 66.1 | — | — | — | — | — | — | — | — | — |