Generalized Referring Expression Segmentation on gRefCOCO (testA)
75.2cIoUPSALM-G5 (ft)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| PSALM-G5 (ft)Category=VLM based, Fine-tuning=true, Training Data=Ground-V2025.05 | 75.2 | 77.3 | 89.7 | — | — | |
| PSALM (ft)Category=VLM based, Fine-tuning=true2025.05 | 74.8 | — | 73.4 | — | — | |
| GETok-RLTraining M-Dec.=false2025.12 | 74.1 | — | — | — | — | |
| DeRIS-LVisual Encoder=Swin-B, Textual Encoder=BEIT3-L2025.07 | 73.73 | 75.3 | 78.3 | — | — | |
| AnchorSeg-LLaVA1.5-7BBackbone=LLaVA1.5-7B, fine-tuned=true2026.04 | 73.43 | 75.75 | 71.78 | — | — | |
| InstAlignBackbone=Swin-B2024.11 | 73.22 | 74.51 | 75.65 | — | — | |
| GSVA (ft)Category=VLM based, Fine-tuning=true2025.05 | 72.8 | 71.1 | 64.7 | — | — | |
| GSVALLM Backbone=Llama2-13B, Finetuning=true2023.12 | 72.79 | 73.29 | 64.72 | — | — | |
| LISA-G5 (ft)Category=VLM based, Fine-tuning=true, Training Data=Ground-V2025.05 | 72.6 | 74.6 | 66.9 | — | — | |
| GETok-SFTTraining M-Dec.=false2025.12 | 72.3 | — | — | — | — | |
| SAM4MLLM-8BVisual Encoder=SAM-EfficientViT-XL1, Textual Encoder=Qwen-VL-7B2025.07 | 72.22 | 74.15 | 63.92 | — | — | |
| SAM4MLLM-8BBackbone=LLaVA1.6, External datasets=true2024.11 | 72.22 | 74.15 | 63.92 | — | — | |
| SAM4MLLM-8BZero-Shot=false2026.03 | 72.2 | 74.2 | — | — | — | |
| DeRIS-BVisual Encoder=Swin-S, Textual Encoder=BEIT3-B2025.07 | 71.99 | 73.72 | 75.98 | — | — | |
| CoHDBackbone=Swin-B2024.05 | 71.85 | 72.67 | 64 | — | — | |
| CoHDBackbone=Swin-B2024.11 | 71.85 | 72.67 | 64 | — | — | |
| PSALM-G5Category=VLM based, Fine-tuning=false, Training Data=Ground-V2025.05 | 71.8 | 74.5 | 83.2 | — | — | |
| GSVATraining M-Dec.=true2025.12 | 71.8 | — | — | — | — | |
| EEVGVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 71.65 | 70.93 | — | — | — | |
| MABPVisual Encoder=Swin-B, Textual Encoder=BERT2024.05 | 71.6 | 72.79 | — | — | — | |
| MABPBackbone=Swin-B2024.11 | 71.59 | 72.81 | — | — | — | |
| LISALLM Backbone=Llama2-13B, Finetuning=true2023.12 | 71 | 69.99 | 55.43 | — | — | |
| UGround-LLaVA1.5-7Bfine-tuned=true2025.10 | 70.87 | 74.29 | 73.93 | — | — | |
| ReLAVisual Encoder=Swin-B, Textual Encoder=BERT2024.05 | 70.78 | 70.89 | — | — | — | |
| GSVALLM Backbone=Vicuna-13B, Finetuning=true2023.12 | 70.51 | 71.75 | 67.25 | — | — | |
| HieA2GVisual Encoder=Swin-B, Textual Encoder=RoBERTa-B2025.07 | 70.4 | 72 | 63.4 | — | — | |
| VisHarnessTraining Data Ratio=0.7%2026.05 | 70.23 | 70.04 | — | — | 63.58 | |
| SAM4MLLM-7BType=MLLM-based Segmentation Network, SAM-based=false, Evaluation Protocol=Supervised2024.11 | 70.1 | — | — | — | — | |
| ReLATraining M-Dec.=true2025.12 | 70 | — | — | — | — | |
| GSVA-7BVisual Encoder=SAM-ViT-H, Textual Encoder=Vicuna-7B2025.07 | 69.93 | 71.08 | 65.31 | — | — | |
| GSVALLM Backbone=Vicuna-7B, Finetuning=true2023.12 | 69.93 | 71.08 | 65.31 | — | — | |
| GSVA-V-7B (ft)Backbone=SAM-ViT-H, Finetuned=true2024.05 | 69.93 | 71.08 | 65.31 | — | — | |
| GSVA-Vicuna-7Bfine-tuned=true2025.10 | 69.93 | 71.08 | 65.31 | — | — | |
| GSVA-7BBackbone=SAM-ViT-H, External datasets=true2024.11 | 69.93 | 71.08 | 65.31 | — | — | |
| GSVA-Vicuna-7BBackbone=Vicuna-7B, fine-tuned=true2026.04 | 69.93 | 71.08 | 65.31 | — | — | |
| GSVA(FT)Training Data Ratio=100%2026.05 | 69.93 | 71.08 | — | — | 65.6 | |
| GSVA(ft)LLM Type=Vicuna-7B, Zero-Shot=false, Fine-tuning=true2024.03 | 69.9 | 71.1 | — | — | — | |
| GSVA-7B(ft)Zero-Shot=false2026.03 | 69.9 | 71.1 | — | — | — | |
| GSVALLM Backbone=Llama2-13B, Finetuning=false2023.12 | 69.86 | 69.52 | 57.84 | — | — | |
| LISALLM Backbone=Vicuna-13B, Finetuning=true2023.12 | 69.65 | 68.18 | 52.16 | — | — | |
| SAM4MLLM-7BBackbone=SAM-EffViT-XL1, External datasets=true2024.11 | 69.62 | 69.05 | 65.96 | — | — | |
| GSVACategory=VLM based, Fine-tuning=false2025.05 | 69.6 | 70.1 | 65.3 | — | — | |
| ReLA2026.01 | 69.43 | 70.12 | — | — | — | |
| ReLAZero-Shot=false2024.03 | 69.3 | 70 | — | — | — | |
| ReLACategory=Specialist, Fine-tuning=false2025.05 | 69.3 | 70 | 59 | — | — | |
| VisHarness-SFTTraining Data Ratio=0.7%2026.05 | 69.29 | 69.19 | — | — | 62.32 | |
| ReLAVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 69.26 | 70.03 | 59.02 | — | — | |
| ReLA2023.06 | 69.26 | 70.03 | — | — | — | |
| ReLA2023.12 | 69.26 | 70.03 | 59.02 | — | — | |
| ReLABackbone=Swin-B2024.05 | 69.26 | 70.03 | 59.02 | — | — | |
| ReLA2025.10 | 69.26 | 70.03 | 59.02 | — | — | |
| ReLABackbone=Swin-B2024.11 | 69.26 | 70.03 | 59.02 | — | — | |
| ReLA2026.04 | 69.26 | 70.03 | 59.02 | — | — | |
| ReLATraining Data Ratio=100%2026.05 | 69.26 | 70.03 | — | — | 64.4 | |
| GSVALLM Backbone=Vicuna-7B, Finetuning=false2023.12 | 69.23 | 70.11 | 63.5 | — | — | |
| GSVA-V-7BBackbone=SAM-ViT-H, Finetuned=false2024.05 | 69.23 | 70.11 | 63.5 | — | — | |
| GSVA-Vicuna-7Bfine-tuned=false2025.10 | 69.23 | 70.11 | 63.5 | — | — | |
| GSVA-Vicuna-7BBackbone=Vicuna-7B2026.04 | 69.23 | 70.11 | 63.5 | — | — | |
| LISA(ft)LLM Type=Vicuna-7B, Zero-Shot=false, Fine-tuning=true2024.03 | 69.2 | 70.1 | — | — | — | |
| GSVALLM Type=Vicuna-7B, Zero-Shot=false, Fine-tuning=false2024.03 | 69.2 | 70.1 | — | — | — | |
| GSVA-7BType=MLLM-based Segmentation Network, SAM-based=true, Evaluation Protocol=Supervised2024.11 | 69.2 | — | — | — | — | |
| LISA (ft)Category=VLM based, Fine-tuning=true2025.05 | 69.2 | 70.1 | 63.5 | — | — | |
| GSVA-7BZero-Shot=false2026.03 | 69.2 | 70.1 | — | — | — | |
| CoHDBackbone=Swin-T2024.05 | 68.93 | 70.17 | 61.52 | — | — | |
| DMMI∗Backbone=Swin-B2024.05 | 68.83 | 68.79 | 58.44 | — | — | |
| HiMTok-8BZero-Shot=false2026.03 | 68.6 | 67.6 | — | — | — | |
| LISA-7BVisual Encoder=SAM-ViT-H, Textual Encoder=Vicuna-7B2025.07 | 68.5 | 66.27 | 50.01 | — | — | |
| LISALLM Backbone=Vicuna-7B, Finetuning=true2023.12 | 68.5 | 66.27 | 50.01 | — | — | |
| LISA-V-7B (ft)Backbone=SAM-ViT-H, Finetuned=true2024.05 | 68.5 | 66.27 | 50.01 | — | — | |
| LISA-Vicuna-7Bfine-tuned=true2025.10 | 68.5 | 66.27 | 50.01 | — | — | |
| LISA-7B(ft)Zero-Shot=false2026.03 | 68.5 | 66.3 | — | — | — | |
| LISA-7BBackbone=SAM-ViT-H, External datasets=true2024.11 | 68.5 | 66.27 | 50.01 | — | — | |
| LISA-Vicuna-7BBackbone=Vicuna-7B, fine-tuned=true2026.04 | 68.5 | 66.27 | 50.01 | — | — | |
| LISA(FT)Training Data Ratio=100%2026.05 | 68.5 | 66.27 | — | — | 62.9 | |
| LISATraining M-Dec.=true2025.12 | 68.2 | — | — | — | — | |
| CGFormerVisual Encoder=Swin-B, Textual Encoder=BERT2024.05 | 68.15 | 70.13 | — | — | — | |
| GSVALLM Backbone=Vicuna-13B, Finetuning=false2023.12 | 67.59 | 67.17 | 54.6 | — | — | |
| LAVT+RELADecoder=ReLA2023.06 | 67.54 | 66.4 | — | — | — | |
| LAVT+ReLAbase_method=LAVT2026.01 | 67.54 | 66.4 | — | — | — | |
| VLT+RELADecoder=ReLA2023.06 | 66.6 | 65.35 | — | — | — | |
| VLT+ReLAbase_method=VLT2026.01 | 66.6 | 65.35 | — | — | — | |
| ReLA†Backbone=Swin-T2024.05 | 66.02 | 65.29 | 48.68 | — | — | |
| LAVTTraining M-Dec.=true2025.12 | 65.9 | — | — | — | — | |
| LAVTVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 65.32 | 65.9 | 49.25 | — | — | |
| LAVT2023.06 | 65.32 | 65.9 | — | — | — | |
| LAVT2023.12 | 65.32 | 65.9 | 49.25 | — | — | |
| LAVTBackbone=Swin-B2024.05 | 65.32 | 65.9 | 49.25 | — | — | |
| LAVTVisual Encoder=Swin-B, Textual Encoder=BERT2024.05 | 65.32 | 65.9 | — | — | — | |
| LAVT2026.01 | 65.32 | 65.9 | — | — | — | |
| LAVT2025.10 | 65.32 | 65.9 | 49.25 | — | — | |
| LAVTBackbone=Swin-B2024.11 | 65.32 | 65.9 | 49.25 | — | — | |
| LAVT2026.04 | 65.32 | 65.9 | 49.25 | — | — | |
| LAVTTraining Data Ratio=100%2026.05 | 65.32 | 65.9 | — | — | 59.7 | |
| LAVTType=Segmentation Specialist, SAM-based=false, Evaluation Protocol=Supervised2024.11 | 65.3 | — | — | — | — | |
| LAVTCategory=Specialist, Fine-tuning=false2025.05 | 65.3 | 65.9 | 49.3 | — | — | |
| CRISVisual Encoder=CLIP-ResNet-101, Textual Encoder=CLIP-B2025.07 | 63.82 | 63.42 | — | — | — | |
| CRIS2023.06 | 63.82 | 63.42 | — | — | — | |
| CRIS2023.12 | 63.82 | 63.42 | — | — | — | |
| CRISBackbone=CLIP-R1012024.05 | 63.82 | 63.42 | — | — | — | |
| CRISVisual Encoder=CLIP-R 101, Textual Encoder=CLIP2024.05 | 63.82 | 63.42 | — | — | — |