Referring Image Segmentation on RefCOCO (test A)
3,081mIoUCAFT
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| CAFTZero-shot=true2026.02 | 3,081 | — | — | — | — | — | — | — | |
| FLAIRZero-shot=true2026.02 | 1,976 | — | — | — | — | — | — | — | |
| SaGZero-shot=true2026.02 | 1,900 | — | — | — | — | — | — | — | |
| MCLIPZero-shot=true2026.02 | 1,185 | — | — | — | — | — | — | — | |
| GViTZero-shot=true2026.02 | 616 | — | — | — | — | — | — | — | |
| DeRIS-LVisual Encoder=Swin-B, Textual Encoder=BEIT3-L2025.07 | 86.64 | — | — | — | — | — | — | — | |
| DeRIS-L (published)Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Reference (published protocol)2026.06 | 86.64 | — | — | — | — | — | — | — | |
| Venice-H1Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Our evaluation pipeline2026.06 | 86.51 | — | — | — | — | — | — | 0.04 | |
| DeRIS-L (reproduced)Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Our evaluation pipeline2026.06 | 86.47 | — | — | — | — | — | — | — | |
| PPCRMLLMs=LLaVA-7B2026.03 | 83.69 | — | 83.55 | — | — | — | — | — | |
| UniRef++-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 83.48 | — | 82.21 | — | — | — | — | — | |
| GLaMM-7BVisual Encoder=SAM-H + CLIP-H, Textual Encoder=Vicuna-7B2025.07 | 83.2 | — | — | — | — | — | — | — | |
| C³VG-oIoUPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 83.18 | — | — | — | — | — | — | — | |
| OneRef-LVisual Encoder=BEIT3-L, Textual Encoder=BEIT3-L2025.07 | 83.06 | — | — | — | — | — | — | — | |
| OneRef-LVisual Enc.=BEiT3-L, Text Enc.=BEiT3-L2026.06 | 83.06 | — | — | — | — | — | — | — | |
| UniRef-LVisual Backbone=Swin-L, Text Encoder=ROBERTa-base2023.12 | 83.03 | — | 81.81 | — | — | — | — | — | |
| DeRIS-BVisual Encoder=Swin-S, Textual Encoder=BEIT3-B2025.07 | 82.97 | — | — | — | — | — | — | — | |
| DeRIS-BVisual Enc.=Swin-S, Text Enc.=BEiT3-B2026.06 | 82.97 | — | — | — | — | — | — | — | |
| C3VGVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | 82.93 | — | — | — | — | — | — | — | |
| C³VGPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 82.93 | — | — | — | — | — | — | — | |
| C3VGVisual Enc.=BEiT3-B, Text Enc.=BEiT3-B2026.06 | 82.93 | — | — | — | — | — | — | — | |
| GLaMMMLLMs=LLaVA-7B2026.03 | 82.78 | — | 81.92 | — | — | — | — | — | |
| VATEX_jointExternal Datasets=RefCOCO(+/g) (368K), Backbone=Swin-B2024.04 | 82.75 | — | — | — | — | — | — | — | |
| SAM4MLLM-8BVisual Encoder=SAM-EfficientViT-XL1, Textual Encoder=Qwen-VL-7B2025.07 | 82.7 | — | — | — | — | — | — | — | |
| SegLLMMLLMs=LLaVA-7B2026.03 | 82.7 | — | 81.69 | — | — | — | — | — | |
| VIPAPublication=-, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 82.63 | — | 80.56 | — | — | — | — | — | |
| UNINEXT-LTraining Data Strategy=Mixed RefCOCO dataset, Model Scale=Large2025.01 | 82.6 | — | — | — | — | — | — | — | |
| DETRIS-L*Tuning Protocol=Parameter Efficient Tuning, Training Data Strategy=Mixed RefCOCO dataset, Model Scale=Large2025.01 | 81.9 | — | — | — | — | — | — | — | |
| OneRefPublication=NeurIPS2024, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 81.86 | — | — | — | — | — | — | — | |
| UniRef++-R50Visual Backbone=RN50, Text Encoder=BERT-base2023.12 | 81.29 | — | 78.75 | — | — | — | — | — | |
| Prompt-RISVisual Encoder=SAM-B + CLIP-B, Textual Encoder=CLIP-B2025.07 | 81.21 | — | — | — | — | — | — | — | |
| Prompt-RISPublication=CVPR2024, Backbone=CLIP-VIT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 81.21 | — | — | — | — | — | — | — | |
| EEVGVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 80.87 | — | — | — | — | — | — | — | |
| EEVGPublication=ECCV2024, Backbone=ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 80.87 | — | — | — | — | — | — | — | |
| CMIRNetMLLMs=–2026.03 | 80.73 | — | 80.44 | — | — | — | — | — | |
| HeROD-G2026.03 | 80.16 | — | — | — | — | — | — | — | |
| UniRef-R50Visual Backbone=RN50, Text Encoder=ROBERTa-base2023.12 | 80.09 | — | 77.28 | — | — | — | — | — | |
| VIPAPublication=-, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 79.93 | — | 78.58 | — | — | — | — | — | |
| VATEXVisual Backbone=Swin-B, Textual Backbone=CLIP2024.04 | 79.64 | — | — | — | — | — | — | — | |
| VATEX_RefCOCOExternal Datasets=RefCOCO (142K), Backbone=Swin-B2024.04 | 79.64 | — | — | — | — | — | — | — | |
| AMLTraining Strategy=Standard2026.02 | 79.53 | — | 78.33 | — | — | — | — | — | |
| MagNetTraining Strategy=Standard2026.02 | 79.43 | — | 78.24 | — | — | — | — | — | |
| TALENTPET=true2026.04 | 79.4 | — | 78.3 | — | — | — | — | — | |
| EEVGPublication=ECCV 2024, Vision Model=ViT-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 79.27 | — | — | — | — | — | — | — | |
| SimVG-SegVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | 79.14 | — | — | — | — | — | — | — | |
| SimVG-SegVisual Enc.=BEiT3-B, Text Enc.=BEiT3-B2026.06 | 79.14 | — | — | — | — | — | — | — | |
| LISA-7B+Visual Encoder=SAM-H + CLIP-L, Textual Encoder=Vicuna-7B2025.07 | 79.1 | — | — | — | — | — | — | — | |
| LISAPublication=CVPR2024, Backbone=Vicuna-7B, Fine-tuned=false2025.01 | 79.1 | — | — | — | — | — | — | — | |
| LISA-7BBackbone=ViT-H2025.12 | 79.1 | — | — | — | — | — | — | — | |
| CARIS*Training Strategy=Standard2026.02 | 79.03 | — | 77.83 | — | — | — | — | — | |
| DETRIS-LTuning Protocol=Parameter Efficient Tuning, Model Scale=Large2025.01 | 79 | — | — | — | — | — | — | — | |
| GSVAPublication=CVPR2024, Backbone=Vicuna-7B, Fine-tuned=false2025.01 | 78.9 | — | — | — | — | — | — | — | |
| GSVA-7BBackbone=ViT-H2025.12 | 78.9 | — | — | — | — | — | — | — | |
| CGFormerVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 78.7 | — | — | — | — | — | — | — | |
| CGFormer2023.09 | 78.7 | — | 77.3 | — | — | — | — | — | |
| CGFormerPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=false2026.02 | 78.7 | — | 77.3 | — | — | — | — | — | |
| CGFormerTraining Strategy=Standard2026.02 | 78.7 | — | 77.3 | — | — | — | — | — | |
| PGBDTraining Strategy=Standard2026.02 | 78.57 | — | 76.89 | — | — | — | — | — | |
| PolyFormer-LVisual Encoder=Swin-L, Textual Encoder=BERT-B2025.07 | 78.49 | — | — | — | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.02 | 78.49 | — | 78.29 | — | — | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 78.49 | — | — | — | — | — | — | — | |
| PolyFormer-L*Training Data Strategy=Mixed RefCOCO dataset, Model Scale=Large2025.01 | 78.3 | — | — | — | — | — | — | — | |
| MagNetTuning Protocol=Traditional Full Fine-tuning2025.01 | 78.2 | — | — | — | — | — | — | — | |
| DETRIS-BTuning Protocol=Parameter Efficient Tuning, Model Scale=Base2025.01 | 78.2 | — | — | — | — | — | — | — | |
| DETRIS-BPublication=AAAI 2025, Vision Model=DINOv2-B, Language Model=CLIP, Multi-dataset training=false2026.02 | 78.2 | — | — | — | — | — | — | — | |
| DETRISPET=true2026.04 | 78.2 | — | — | — | — | — | — | — | |
| RISCLIP-BTuning Protocol=Traditional Full Fine-tuning, Model Scale=Base2025.01 | 78 | — | — | — | — | — | — | — | |
| RISCLIPPET=true2026.04 | 78 | — | 76.5 | — | — | — | — | — | |
| VG-LAWVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 77.51 | — | — | — | — | — | — | — | |
| DETRIS*Training Strategy=Standard2026.02 | 77.39 | — | 76.68 | — | — | — | — | — | |
| VG-LAWVisual Backbone=ViT-B, Textual Backbone=BERT2024.04 | 77.36 | — | — | — | — | — | — | — | |
| CGFormerTuning Protocol=Traditional Full Fine-tuning2025.01 | 77.3 | — | — | — | — | — | — | — | |
| CoupAlignMLLMs=–2026.03 | 77.15 | — | 77.76 | — | — | — | — | — | |
| PVDVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 77.11 | — | — | — | — | — | — | — | |
| PVDPublication=AAAI2024, Backbone=Swin-B, Data=Com-RefC, Fine-tuned=true2025.01 | 77.11 | — | — | — | — | — | — | — | |
| DMMITuning Protocol=Traditional Full Fine-tuning2025.01 | 77.1 | — | — | — | — | — | — | — | |
| PolyFormer-BVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 77.09 | — | 76.64 | — | — | — | — | — | |
| PolyFormer-BExternal Datasets=RefCOCO(+/g) (368K)2024.04 | 77.09 | — | — | — | — | — | — | — | |
| PolyFormerPublication=CVPR2023, Backbone=Swin-B, Data=Com-RefC, Fine-tuned=true2025.01 | 77.09 | — | — | — | — | — | — | — | |
| PolyFormer-BPublication=CVPR 2023, Vision Model=Swin-B, Language Model=BERT-B, Multi-dataset training=true2026.02 | 77.09 | — | 76.64 | — | — | — | — | — | |
| OmniSegNetBackbone=Swin-B2025.12 | 76.93 | — | — | — | — | — | — | — | |
| ETOGPET=true2026.04 | 76.9 | — | 76.1 | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Text Encoder=BERT-base2023.02 | 76.89 | — | — | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Text Encoder=BERT-base2023.12 | 76.89 | — | 75.82 | — | — | — | — | — | |
| LAVTVisual Backbone=Swin-B, Textual Backbone=BERT2024.04 | 76.89 | — | — | — | — | — | — | — | |
| LAVTPublication=CVPR2022, Backbone=Swin-B, Data=RefC, Fine-tuned=false2025.01 | 76.89 | — | — | — | — | — | — | — | |
| LAVTTraining Strategy=Standard2026.02 | 76.89 | — | 75.82 | — | — | — | — | — | |
| LAVTMLLMs=–2026.03 | 76.89 | — | 75.82 | — | — | — | — | — | |
| LAVTVisual Enc.=Swin-B, Text Enc.=BERT-B2026.06 | 76.89 | — | — | — | — | — | — | — | |
| LQMFormerBackbone=Swin-B2025.12 | 76.82 | — | — | — | — | — | — | — | |
| RefTrVisual Backbone=RN101, Text Encoder=BERT-base2023.02 | 76.77 | — | — | — | — | — | — | — | |
| RefTrVisual Backbone=RN101, Text Encoder=BERT-base2023.12 | 76.77 | — | — | — | — | — | — | — | |
| RefTRExternal Datasets=Visual Genome (5.4M) & Flickr30k-entities (158K)2024.04 | 76.77 | — | — | — | — | — | — | — | |
| ReMamberTuning Protocol=Traditional Full Fine-tuning2025.01 | 76.7 | — | — | — | — | — | — | — | |
| LISA-7BVisual Backbone=ViT-H SAM, Textual Backbone=Vicuna-7B2024.04 | 76.5 | — | — | — | — | — | — | — | |
| ReLA (2023b)Tuning Protocol=Traditional Full Fine-tuning2025.01 | 76.5 | — | — | — | — | — | — | — | |
| ReLA (2023a)Tuning Protocol=Traditional Full Fine-tuning2025.01 | 76.5 | — | — | — | — | — | — | — | |
| LISA-7BTuning Protocol=Traditional Full Fine-tuning, Model Scale=7B2025.01 | 76.5 | — | — | — | — | — | — | — | |
| PixelLM-7BBackbone=CLIP-ViT-L2025.12 | 76.5 | — | — | — | — | — | — | — | |
| ReLAPublication=CVPR2023, Backbone=Swin-B, Data=RefC, Fine-tuned=false2025.01 | 76.48 | — | — | — | — | — | — | — |