Referring Image Segmentation on RefCOCO+ (test B)
78.84mIoUVenice-H1
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Venice-H1Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Our evaluation pipeline2026.06 | 78.84 | — | — | — | — | — | 0.21 | |
| DeRIS-L (reproduced)Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Our evaluation pipeline2026.06 | 78.63 | — | — | — | — | — | — | |
| DeRIS-LVisual Encoder=Swin-B, Textual Encoder=BEIT3-L2025.07 | 78.59 | — | — | — | — | — | — | |
| DeRIS-L (published)Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Reference (published protocol)2026.06 | 78.59 | — | — | — | — | — | — | |
| OneRef-LVisual Encoder=BEIT3-L, Textual Encoder=BEIT3-L2025.07 | 72.95 | — | — | — | — | — | — | |
| OneRef-LVisual Enc.=BEiT3-L, Text Enc.=BEiT3-L2026.06 | 72.95 | — | — | — | — | — | — | |
| C3VGVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | 72.4 | — | — | — | — | — | — | |
| C³VGPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 72.4 | — | — | — | — | — | — | |
| C3VGVisual Enc.=BEiT3-B, Text Enc.=BEiT3-B2026.06 | 72.4 | — | — | — | — | — | — | |
| DeRIS-BVisual Encoder=Swin-S, Textual Encoder=BEIT3-B2025.07 | 71.63 | — | — | — | — | — | — | |
| DeRIS-BVisual Enc.=Swin-S, Text Enc.=BEiT3-B2026.06 | 71.63 | — | — | — | — | — | — | |
| DETRIS-L*Tuning Protocol=Parameter Efficient Tuning, Training Data Strategy=Mixed RefCOCO dataset, Model Scale=Large2025.01 | 70.2 | — | — | — | — | — | — | |
| OneRefPublication=NeurIPS2024, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 69.58 | — | — | — | — | — | — | |
| PPCRMLLMs=LLaVA-7B2026.03 | 69.33 | — | 65.55 | — | — | — | — | |
| C³VG-oIoUPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 68.95 | — | — | — | — | — | — | |
| VATEX_jointExternal Datasets=RefCOCO(+/g) (368K), Backbone=Swin-B2024.04 | 68.52 | — | — | — | — | — | — | |
| GLaMMMLLMs=LLaVA-7B2026.03 | 68.38 | — | 64.6 | — | — | — | — | |
| UniRef-LVisual Backbone=Swin-L, Text Encoder=ROBERTa-base2023.12 | 68.33 | — | 63.14 | — | — | — | — | |
| UniRef++-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 68.31 | — | 61.45 | — | — | — | — | |
| OracleBackbone=ResNet-50, Segmentor=true2024.10 | 68.2 | — | — | — | — | — | — | |
| SimVG-SegVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | 67.85 | — | — | — | — | — | — | |
| SimVG-SegVisual Enc.=BEiT3-B, Text Enc.=BEiT3-B2026.06 | 67.85 | — | — | — | — | — | — | |
| VIPAPublication=-, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 67.44 | — | 63.34 | — | — | — | — | |
| SegLLMMLLMs=LLaVA-7B2026.03 | 67.43 | — | 62.11 | — | — | — | — | |
| SAM4MLLM-8BVisual Encoder=SAM-EfficientViT-XL1, Textual Encoder=Qwen-VL-7B2025.07 | 67.2 | — | — | — | — | — | — | |
| CMIRNetMLLMs=–2026.03 | 66.86 | — | 62.07 | — | — | — | — | |
| PolyFormer-LVisual Encoder=Swin-L, Textual Encoder=BERT-B2025.07 | 66.73 | — | — | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.02 | 66.73 | — | 61.87 | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 66.73 | — | — | — | — | — | — | |
| EEVGVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 66.31 | — | — | — | — | — | — | |
| EEVGPublication=ECCV2024, Backbone=ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 66.31 | — | — | — | — | — | — | |
| DETRIS-LTuning Protocol=Parameter Efficient Tuning, Model Scale=Large2025.01 | 64.7 | — | — | — | — | — | — | |
| PolyFormer-BVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 64.64 | — | 59.33 | — | — | — | — | |
| PolyFormer-BExternal Datasets=RefCOCO(+/g) (368K)2024.04 | 64.64 | — | — | — | — | — | — | |
| PolyFormerPublication=CVPR2023, Backbone=Swin-B, Data=Com-RefC, Fine-tuned=true2025.01 | 64.64 | — | — | — | — | — | — | |
| PolyFormer-BPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 64.64 | — | 59.33 | — | — | — | — | |
| AMLTraining Strategy=Standard2026.02 | 64.61 | — | 59.51 | — | — | — | — | |
| GLaMM-7BVisual Encoder=SAM-H + CLIP-H, Textual Encoder=Vicuna-7B2025.07 | 64.6 | — | — | — | — | — | — | |
| Prompt-RISVisual Encoder=SAM-B + CLIP-B, Textual Encoder=CLIP-B2025.07 | 64.25 | — | — | — | — | — | — | |
| Prompt-RISPublication=CVPR2024, Backbone=CLIP-VIT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 64.25 | — | — | — | — | — | — | |
| HeROD-G2026.03 | 63.86 | — | — | — | — | — | — | |
| MagNetTraining Strategy=Standard2026.02 | 63.59 | — | 58.14 | — | — | — | — | |
| TALENTPET=true2026.04 | 63.4 | — | 58.8 | — | — | — | — | |
| UniRef++-R50Visual Backbone=RN50, Text Encoder=BERT-base2023.12 | 63.35 | — | 56.26 | — | — | — | — | |
| VIPAPublication=-, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 62.96 | — | 60.15 | — | — | — | — | |
| CARIS*Training Strategy=Standard2026.02 | 62.69 | — | 57.97 | — | — | — | — | |
| UniRef-R50Visual Backbone=RN50, Text Encoder=ROBERTa-base2023.12 | 62.62 | — | 55.56 | — | — | — | — | |
| UNINEXT-LTraining Data Strategy=Mixed RefCOCO dataset, Model Scale=Large2025.01 | 62.6 | — | — | — | — | — | — | |
| VATEXVisual Backbone=Swin-B, Textual Backbone=CLIP2024.04 | 62.52 | — | — | — | — | — | — | |
| VATEX_RefCOCO+External Datasets=RefCOCO+ (141K), Backbone=Swin-B2024.04 | 62.52 | — | — | — | — | — | — | |
| EEVGPublication=ECCV 2024, Vision Model=ViT-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 62.33 | — | — | — | — | — | — | |
| PolyFormer-L*Training Data Strategy=Mixed RefCOCO dataset, Model Scale=Large2025.01 | 61.9 | — | — | — | — | — | — | |
| CGFormerVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 61.72 | — | — | — | — | — | — | |
| CGFormer2023.09 | 61.72 | — | 57.14 | — | — | — | — | |
| CGFormerPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 61.72 | — | 57.14 | — | — | — | — | |
| CGFormerTraining Strategy=Standard2026.02 | 61.72 | — | 57.14 | — | — | — | — | |
| PGBDTraining Strategy=Standard2026.02 | 61.56 | — | 56.98 | — | — | — | — | |
| DETRIS-BTuning Protocol=Parameter Efficient Tuning, Model Scale=Base2025.01 | 61.5 | — | — | — | — | — | — | |
| DETRIS-BPublication=AAAI 2025, Vision Model=DINOv2-B, Language Model=CLIP, Multi-dataset training=false2026.02 | 61.5 | — | — | — | — | — | — | |
| DETRISPET=true2026.04 | 61.5 | — | — | — | — | — | — | |
| RISCLIP-BTuning Protocol=Traditional Full Fine-tuning, Model Scale=Base2025.01 | 60.7 | — | — | — | — | — | — | |
| RISCLIPPET=true2026.04 | 60.7 | — | 55.5 | — | — | — | — | |
| CoupAlignMLLMs=–2026.03 | 60.23 | — | 56.69 | — | — | — | — | |
| DETRIS*Training Strategy=Standard2026.02 | 60 | — | 55.82 | — | — | — | — | |
| VG-LAWVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 59.89 | — | — | — | — | — | — | |
| GSVAPublication=CVPR2024, Backbone=Vicuna-7B, Fine-tuned=false2025.01 | 59.8 | — | — | — | — | — | — | |
| GSVA-7BBackbone=ViT-H2025.12 | 59.8 | — | — | — | — | — | — | |
| RefTrVisual Backbone=RN101, Text Encoder=BERT-base2023.02 | 59.4 | — | — | — | — | — | — | |
| RefTrVisual Backbone=RN101, Text Encoder=BERT-base2023.12 | 59.4 | — | — | — | — | — | — | |
| RefTRExternal Datasets=Visual Genome (5.4M) & Flickr30k-entities (158K)2024.04 | 59.4 | — | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 59.23 | — | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Text Encoder=BERT-base2023.12 | 59.23 | — | 55.1 | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Textual Backbone=BERT2024.04 | 59.23 | — | — | — | — | — | — | |
| LAVTPublication=CVPR2022, Backbone=Swin-B, Data=RefC, Fine-tuned=false2025.01 | 59.23 | — | — | — | — | — | — | |
| LAVTTraining Strategy=Standard2026.02 | 59.23 | — | 55.1 | — | — | — | — | |
| LAVTMLLMs=–2026.03 | 59.23 | — | 55.1 | — | — | — | — | |
| LAVTVisual Enc.=Swin-B, Text Enc.=BERT-B2026.06 | 59.23 | — | — | — | — | — | — | |
| LAVT+Backbone=Swin-Base2024.10 | 59.2 | — | — | — | — | — | — | |
| SeqTRVisual Backbone=DN53, Text Encoder=Bi-GRU2023.02 | 58.97 | — | — | — | — | — | — | |
| SeqTRVisual Backbone=DN53, Text Encoder=Bi-GRU2023.12 | 58.97 | — | — | — | — | — | — | |
| SeqTRExternal Datasets=Visual Genome (5.4M) & Flickr30k-entities (158K)2024.04 | 58.97 | — | — | — | — | — | — | |
| SeqTRPublication=ECCV2022, Backbone=DarkNet53, Data=Com-RefC, Fine-tuned=true2025.01 | 58.97 | — | — | — | — | — | — | |
| OmniSegNetBackbone=Swin-B2025.12 | 58.31 | — | — | — | — | — | — | |
| PixelLM-7BBackbone=CLIP-ViT-L2025.12 | 58.3 | — | — | — | — | — | — | |
| VG-LAWVisual Backbone=ViT-B, Textual Backbone=BERT2024.04 | 58.14 | — | — | — | — | — | — | |
| LISA-7B+Visual Encoder=SAM-H + CLIP-L, Textual Encoder=Vicuna-7B2025.07 | 58.1 | — | — | — | — | — | — | |
| LISAPublication=CVPR2024, Backbone=Vicuna-7B, Fine-tuned=false2025.01 | 58.1 | — | — | — | — | — | — | |
| MagNetTuning Protocol=Traditional Full Fine-tuning2025.01 | 58.1 | — | — | — | — | — | — | |
| LISA-7BBackbone=ViT-H2025.12 | 58.1 | — | — | — | — | — | — | |
| ReLA (2023b)Tuning Protocol=Traditional Full Fine-tuning2025.01 | 57.7 | — | — | — | — | — | — | |
| ReLA (2023a)Tuning Protocol=Traditional Full Fine-tuning2025.01 | 57.7 | — | — | — | — | — | — | |
| ReLAPublication=CVPR2023, Backbone=Swin-B, Data=RefC, Fine-tuned=false2025.01 | 57.65 | — | — | — | — | — | — | |
| ReLABackbone=Swin-B2025.12 | 57.65 | — | — | — | — | — | — | |
| LQMFormerBackbone=Swin-B2025.12 | 57.59 | — | — | — | — | — | — | |
| ReMamberTuning Protocol=Traditional Full Fine-tuning2025.01 | 57.5 | — | — | — | — | — | — | |
| CGFormerTuning Protocol=Traditional Full Fine-tuning2025.01 | 57.1 | — | — | — | — | — | — | |
| DMMITuning Protocol=Traditional Full Fine-tuning2025.01 | 57 | — | — | — | — | — | — | |
| PVDVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 56.92 | — | — | — | — | — | — | |
| VLTVisual Backbone=Swin-B, Textual Backbone=BERT2024.04 | 56.92 | — | — | — | — | — | — | |
| PVDPublication=AAAI2024, Backbone=Swin-B, Data=Com-RefC, Fine-tuned=true2025.01 | 56.92 | — | — | — | — | — | — |