Referring Image Segmentation on RefCOCOg (val (U))
80.01mIoUDeRIS-L
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DeRIS-LVisual Encoder=Swin-B, Textual Encoder=BEIT3-L2025.07 | 80.01 | — | — | — | |
| DeRIS-L (published)Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Reference (published protocol)2026.06 | 80.01 | — | — | — | |
| DeRIS-L (reproduced)Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Our evaluation pipeline2026.06 | 79.8 | — | — | — | |
| Venice-H1Visual Enc.=Swin-B, Text Enc.=BEiT3-L, Evaluation pipeline=Our evaluation pipeline2026.06 | 79.8 | — | — | 0 | |
| UniRef-LVisual Backbone=Swin-L, Text Encoder=ROBERTa-base2023.12 | 76.65 | — | 73.04 | — | |
| C3VGVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | 76.34 | — | — | — | |
| C³VGPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 76.34 | — | — | — | |
| C3VGVisual Enc.=BEiT3-B, Text Enc.=BEiT3-B2026.06 | 76.34 | — | — | — | |
| DeRIS-BVisual Encoder=Swin-S, Textual Encoder=BEIT3-B2025.07 | 76.3 | — | — | — | |
| DeRIS-BVisual Enc.=Swin-S, Text Enc.=BEiT3-B2026.06 | 76.3 | — | — | — | |
| UniRef++-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 76 | — | 71.37 | — | |
| PPCRMLLMs=LLaVA-7B2026.03 | 75.94 | — | 74.92 | — | |
| OneRef-LVisual Encoder=BEIT3-L, Textual Encoder=BEIT3-L2025.07 | 75.68 | — | — | — | |
| OneRef-LVisual Enc.=BEiT3-L, Text Enc.=BEiT3-L2026.06 | 75.68 | — | — | — | |
| SAM4MLLM-8BVisual Encoder=SAM-EfficientViT-XL1, Textual Encoder=Qwen-VL-7B2025.07 | 75.5 | — | — | — | |
| GLaMMMLLMs=LLaVA-7B2026.03 | 75.11 | — | 73.66 | — | |
| C³VG-oIoUPublication=AAAI2025, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 74.43 | — | — | — | |
| GLaMM-7BVisual Encoder=SAM-H + CLIP-H, Textual Encoder=Vicuna-7B2025.07 | 74.2 | — | — | — | |
| SegLLMMLLMs=LLaVA-7B2026.03 | 74.19 | — | 72.3 | — | |
| OneRefPublication=NeurIPS2024, Backbone=BEIT3-ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 74.05 | — | — | — | |
| EEVGVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 73.56 | — | — | — | |
| EEVGPublication=ECCV2024, Backbone=ViT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 73.56 | — | — | — | |
| UniRef++-R50Visual Backbone=RN50, Text Encoder=BERT-base2023.12 | 73.37 | — | 68.38 | — | |
| GSVAPublication=CVPR2024, Backbone=Vicuna-7B, Fine-tuned=false2025.01 | 72.7 | — | — | — | |
| GSVA-7BBackbone=ViT-H2025.12 | 72.7 | — | — | — | |
| CMIRNetMLLMs=–2026.03 | 72.6 | — | 70.36 | — | |
| SimVG-SegVisual Encoder=BEIT3-B, Textual Encoder=BEIT3-B2025.07 | 72.19 | — | — | — | |
| SimVG-SegVisual Enc.=BEiT3-B, Text Enc.=BEiT3-B2026.06 | 72.19 | — | — | — | |
| UniRef-R50Visual Backbone=RN50, Text Encoder=ROBERTa-base2023.12 | 71.76 | — | 66.96 | — | |
| PolyFormer-LVisual Encoder=Swin-L, Textual Encoder=BERT-B2025.07 | 71.15 | — | — | — | |
| PolyFormer-LVisual Backbone=Swin-L, Text Encoder=BERT-base2023.12 | 71.15 | — | — | — | |
| Prompt-RISVisual Encoder=SAM-B + CLIP-B, Textual Encoder=CLIP-B2025.07 | 70.47 | — | — | — | |
| Prompt-RISPublication=CVPR2024, Backbone=CLIP-VIT-B, Data=Com-RefC, Fine-tuned=true2025.01 | 70.47 | — | — | — | |
| PolyFormerPublication=CVPR2023, Backbone=Swin-B, Data=Com-RefC, Fine-tuned=true2025.01 | 69.36 | — | — | — | |
| PixelLM-7BBackbone=CLIP-ViT-L2025.12 | 69.3 | — | — | — | |
| LISA-7B+Visual Encoder=SAM-H + CLIP-L, Textual Encoder=Vicuna-7B2025.07 | 67.9 | — | — | — | |
| LISAPublication=CVPR2024, Backbone=Vicuna-7B, Fine-tuned=false2025.01 | 67.9 | — | — | — | |
| LISA-7BBackbone=ViT-H2025.12 | 67.9 | — | — | — | |
| CGFormerVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 67.57 | — | — | — | |
| RefTrVisual Backbone=RN101, Text Encoder=BERT-base2023.12 | 66.63 | — | — | — | |
| VG-LAWVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 65.53 | — | — | — | |
| ReLAPublication=CVPR2023, Backbone=Swin-B, Data=RefC, Fine-tuned=false2025.01 | 65 | — | — | — | |
| ReLABackbone=Swin-B2025.12 | 65 | — | — | — | |
| OmniSegNetBackbone=Swin-B2025.12 | 64.9 | — | — | — | |
| LQMFormerBackbone=Swin-B2025.12 | 64.73 | — | — | — | |
| SeqTRVisual Backbone=DN53, Text Encoder=Bi-GRU2023.12 | 64.69 | — | — | — | |
| SeqTRPublication=ECCV2022, Backbone=DarkNet53, Data=Com-RefC, Fine-tuned=true2025.01 | 64.69 | — | — | — | |
| CoupAlignMLLMs=–2026.03 | 63.76 | — | 62.84 | — | |
| LAVTVisual Backbone=Swin-B, Text Encoder=BERT-base2023.12 | 63.34 | — | 61.24 | — | |
| LAVTPublication=CVPR2022, Backbone=Swin-B, Data=RefC, Fine-tuned=false2025.01 | 63.34 | — | — | — | |
| LAVTMLLMs=–2026.03 | 63.34 | — | 61.23 | — | |
| LAVTVisual Enc.=Swin-B, Text Enc.=BERT-B2026.06 | 63.34 | — | — | — | |
| PVDVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 63.13 | — | — | — | |
| PVDPublication=AAAI2024, Backbone=Swin-B, Data=Com-RefC, Fine-tuned=true2025.01 | 63.13 | — | — | — | |
| LAVTBackbone=Swin-B2025.12 | 61.24 | — | — | — | |
| LISAMLLMs=LLaVA-7B2026.03 | 61.08 | — | 60.91 | — | |
| DITBackbone=ViT-B2025.12 | 60.18 | — | — | — | |
| CRISVisual Backbone=RN101, Text Encoder=GPT-22023.12 | 59.87 | — | — | — | |
| CRISPublication=CVPR2022, Backbone=ResNet101, Data=RefC, Fine-tuned=false2025.01 | 59.87 | — | — | — | |
| CRISVisual Enc.=CLIP-RN101, Text Enc.=CLIP-T2026.06 | 59.87 | — | — | — | |
| CRISMLLMs=–2026.03 | 59.69 | — | — | — | |
| VLTVisual Backbone=DN53, Text Encoder=Bi-GRU2023.12 | 52.99 | — | — | — | |
| MCNPublication=CVPR2020, Backbone=DarkNet53, Data=RefC, Fine-tuned=false2025.01 | 49.22 | — | — | — | |
| ASDAMLLMs=–2026.03 | — | — | 65.73 | — | |
| CARISMLLMs=–2026.03 | — | — | 67.95 | — | |
| CRIS2024.09 | — | 59.9 | — | — | |
| DeRIS-7BVisual Enc.=Swin-B+SigLIP, Text Enc.=Qwen2-OV-7B2026.06 | — | 80.62 | — | — | |
| DeRIS-7B+Visual Encoder=Swin-B + SigLIP, Textual Encoder=Qwen2-OV-7B2025.07 | — | 80.62 | — | — | |
| EEVGMethod Category=Specialist Methods2026.06 | — | 73.6 | — | — | |
| GLaMM2026.03 | — | 74.2 | — | — | |
| GLaMM-7BMethod Category=MLLM-based Methods, Model Size=7B2026.06 | — | 74.2 | — | — | |
| GLaMM-7BVisual Enc.=SAM-H+CLIP-H, Text Enc.=Vicuna-7B2026.06 | — | 74.2 | — | — | |
| GSVAMLLMs=LLaVA-7B2026.03 | — | — | 72.7 | — | |
| GSVA-13BVisual Encoder=SAM-H + CLIP-L, Textual Encoder=Vicuna-13B2025.07 | — | — | 74.2 | — | |
| GSVA-13BVisual Enc.=SAM-H+CLIP-L, Text Enc.=Vicuna-13B2026.06 | — | 74.2 | — | — | |
| HyperSeg2026.03 | — | 79.4 | — | — | |
| InstanceVGMethod Category=Specialist Methods2026.06 | — | 75.9 | — | — | |
| InstructSeg2026.03 | — | 79.3 | — | — | |
| LAVT2024.09 | — | 61.2 | — | — | |
| LISA-7BModel size=7B2024.09 | — | 66.4 | — | — | |
| LISA-7BModel size=7B2026.03 | — | 67.9 | — | — | |
| LISA-7BMethod Category=MLLM-based Methods, Model Size=7B2026.06 | — | 67.9 | — | — | |
| LISA-7BVisual Enc.=SAM-H+CLIP-L, Text Enc.=Vicuna-7B2026.06 | — | 67.9 | — | — | |
| LTSVisual Backbone=DN53, Text Encoder=Bi-GRU2023.12 | — | — | 54.4 | — | |
| MCNVisual Backbone=DN53, Text Encoder=Bi-GRU2023.12 | — | — | 49.22 | — | |
| MCN2024.09 | — | 49.2 | — | — | |
| MomentSeg-7BMethod Category=MLLM-based Methods, Model Size=7B2026.06 | — | 70.8 | — | — | |
| NExT-ChatMLLMs=7B2026.03 | — | — | 67 | — | |
| OMG-LLaVA-7BMethod Category=MLLM-based Methods, Model Size=7B2026.06 | — | 70.7 | — | — | |
| PixelLM-7BModel size=7B2026.03 | — | 69.3 | — | — | |
| PropVGMethod Category=Specialist Methods2026.06 | — | 77 | — | — | |
| ReLA2024.09 | — | 65 | — | — | |
| ReLAMethod Category=Specialist Methods2026.06 | — | 65 | — | — | |
| ReMamberVisual Encoder=Mamba-B, Textual Encoder=CLIP-B2025.07 | — | 63.9 | — | — | |
| Sa2VA-4BMethod Category=MLLM-based Methods, Model Size=4B2026.06 | — | 74.1 | — | — | |
| SAM4MLLM-8BVisual Enc.=SAM-EfViT-XL1, Text Enc.=Qwen-VL-7B2026.06 | — | 75.5 | — | — | |
| SAM4MLLMs-PQPPMLLMs=Qwen-VL-7B2026.03 | — | — | 74.5 | — | |
| SEEM2024.09 | — | 65.7 | — | — | |
| VideoLISA-3.8BModel size=3.8B2024.09 | — | 68.3 | — | — | |
| VideoSEG-O3-4BMethod Category=RL-based Methods, Model Size=4B2026.06 | — | 78.9 | — | — |