Generalized Referring Expression Segmentation on gRefCOCO (val)
72.2cIoUSegCompass-7B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SegCompass-7BBackbone=Qwen2.5-VL2026.05 | 72.2 | 76.1 | — | — | — | |
| SegCompass-13BBackbone=LLaVA-1.52026.05 | 72.2 | 76.8 | — | — | — | |
| DeRIS-LVisual Encoder=Swin-B, Textual Encoder=BEIT3-L2025.07 | 72 | 77.67 | 82.22 | — | — | |
| SegCompass-7BBackbone=LLaVA-1.52026.05 | 70.6 | 75 | — | — | — | |
| RAS-13BYear=2025, Backbone=LLaVA-1.52026.05 | 70.5 | 74.6 | — | — | — | |
| HiMTok-8BYear=2025, Backbone=InternVL-2.52026.05 | 70.4 | 72.1 | — | — | — | |
| UniRES-7BYear=2025, Backbone=LLaVA-1.52026.05 | 69.9 | 74.4 | — | — | — | |
| Text4Seg-13BYear=2025, Backbone=LLaVA-1.52026.05 | 69.8 | 74.8 | — | — | — | |
| PSALM (ft)Category=VLM based, Fine-tuning=true2025.05 | 69.3 | — | 78.3 | — | — | |
| InstAlignBackbone=Swin-B2024.11 | 68.94 | 74.34 | 79.72 | — | — | |
| AnchorSeg-LLaVA1.5-7BBackbone=LLaVA1.5-7B, fine-tuned=true2026.04 | 68.68 | 74.76 | 76 | — | — | |
| DeRIS-BVisual Encoder=Swin-S, Textual Encoder=BEIT3-B2025.07 | 68.06 | 74.1 | 77.03 | — | — | |
| PSALM-G5 (ft)Category=VLM based, Fine-tuning=true, Training Data=Ground-V2025.05 | 68 | 67.3 | 87.2 | — | — | |
| GSVATraining M-Dec.=true2025.12 | 68 | — | — | — | — | |
| Text4Seg-7BYear=2025, Backbone=LLaVA-1.52026.05 | 67.9 | 73.6 | — | — | — | |
| SAM4MLLM-8BVisual Encoder=SAM-EfficientViT-XL1, Textual Encoder=Qwen-VL-7B2025.07 | 67.83 | 71.86 | 66.08 | — | — | |
| SAM4MLLM-8BBackbone=LLaVA1.6, External datasets=true2024.11 | 67.83 | 71.86 | 66.08 | — | — | |
| SAM4MLLM-8BZero-Shot=false2026.03 | 67.8 | 71.9 | — | — | — | |
| SAM4MLLM-7BYear=2024, Backbone=LLaVA-1.62026.05 | 67.8 | 71.9 | — | — | — | |
| GETok-RLTraining M-Dec.=false2025.12 | 67.4 | — | — | — | — | |
| PSALM-G5Category=VLM based, Fine-tuning=false, Training Data=Ground-V2025.05 | 67.3 | 64.6 | 83.3 | — | — | |
| GETok-SFTTraining M-Dec.=false2025.12 | 66.9 | — | — | — | — | |
| HiMTok-8BZero-Shot=false2026.03 | 66.8 | 68.7 | — | — | — | |
| GroundHog-7BType=MLLM-based Segmentation Network, SAM-based=false, Evaluation Protocol=Supervised2024.11 | 66.7 | — | — | — | — | |
| GSVA (ft)Category=VLM based, Fine-tuning=true2025.05 | 66.4 | 66.5 | 66 | — | — | |
| SAM4MLLM-7BType=MLLM-based Segmentation Network, SAM-based=false, Evaluation Protocol=Supervised2024.11 | 66.3 | — | — | — | — | |
| MABPBackbone=Swin-B2024.11 | 65.72 | 68.86 | 62.18 | — | — | |
| MABPVisual Encoder=Swin-B, Textual Encoder=BERT2024.05 | 65.69 | 68.79 | — | — | — | |
| SAM4MLLM-7BBackbone=SAM-EffViT-XL1, External datasets=true2024.11 | 65.66 | 68.37 | 63.71 | — | — | |
| LISA-G5 (ft)Category=VLM based, Fine-tuning=true, Training Data=Ground-V2025.05 | 65.6 | 68.2 | 61.3 | — | — | |
| UGround-LLaVA1.5-7Bfine-tuned=true2025.10 | 65.56 | 72.46 | 74.53 | — | — | |
| CoHDBackbone=Swin-B2024.05 | 65.17 | 68.42 | 63.68 | — | — | |
| CoHDBackbone=Swin-B2024.11 | 65.17 | 68.42 | 63.38 | — | — | |
| LQMFormerBackbone=Swin-B2024.11 | 64.98 | 70.94 | 67.47 | — | — | |
| HieA2GVisual Encoder=Swin-B, Textual Encoder=RoBERTa-B2025.07 | 64.2 | 68.4 | 62.8 | — | — | |
| ReLAVisual Encoder=Swin-B, Textual Encoder=BERT2024.05 | 64.2 | 65.5 | — | — | — | |
| EEVGVisual Encoder=ViT-B, Textual Encoder=BERT-B2025.07 | 64.04 | 62.75 | — | — | — | |
| GSVA-13BYear=2024, Backbone=LLaVA-1.52026.05 | 64 | 68 | — | — | — | |
| ReLATraining M-Dec.=true2025.12 | 63.6 | — | — | — | — | |
| LISATraining M-Dec.=true2025.12 | 63.5 | — | — | — | — | |
| GSVA(ft)LLM Type=Vicuna-7B, Zero-Shot=false, Fine-tuning=true2024.03 | 63.3 | 66.5 | — | — | — | |
| GSVA-7B(ft)Zero-Shot=false2026.03 | 63.3 | 66.5 | — | — | — | |
| GSVA-7BYear=2024, Backbone=LLaVA-1.52026.05 | 63.3 | 66.5 | — | — | — | |
| GSVA-7BVisual Encoder=SAM-ViT-H, Textual Encoder=Vicuna-7B2025.07 | 63.29 | 66.47 | 62.43 | — | — | |
| GSVA-V-7B (ft)Backbone=SAM-ViT-H, Finetuned=true2024.05 | 63.29 | 66.47 | 62.43 | — | — | |
| GSVA-Vicuna-7Bfine-tuned=true2025.10 | 63.29 | 66.47 | 62.43 | — | — | |
| GSVA-7BBackbone=SAM-ViT-H, External datasets=true2024.11 | 63.29 | 66.47 | 62.43 | — | — | |
| GSVA-Vicuna-7BBackbone=Vicuna-7B, fine-tuned=true2026.04 | 63.29 | 66.47 | 62.43 | — | — | |
| GSVA(FT)Training Data Ratio=100%2026.05 | 63.29 | 66.47 | — | — | 65.6 | |
| CoHDBackbone=Swin-T2024.05 | 62.95 | 65.89 | 60.95 | — | — | |
| ReLA2026.01 | 62.91 | 63.98 | — | — | — | |
| LISA-13BYear=2024, Backbone=LLaVA-1.52026.05 | 62.9 | 63.4 | — | — | — | |
| DMMI∗Backbone=Swin-B2024.05 | 62.78 | 62.68 | 53.2 | — | — | |
| ReLAVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 62.42 | 63.6 | 56.37 | — | — | |
| ReLA2023.06 | 62.42 | 63.6 | — | — | — | |
| ReLABackbone=Swin-B2024.05 | 62.42 | 63.6 | 56.37 | — | — | |
| ReLA2025.10 | 62.42 | 63.6 | 56.37 | — | — | |
| ReLABackbone=Swin-B2024.11 | 62.42 | 63.6 | 56.37 | — | — | |
| ReLA2026.04 | 62.42 | 63.6 | 56.37 | — | — | |
| ReLATraining Data Ratio=100%2026.05 | 62.42 | 63.6 | — | — | 64.4 | |
| ReLAZero-Shot=false2024.03 | 62.4 | 63.6 | — | — | — | |
| ReLACategory=Specialist, Fine-tuning=false2025.05 | 62.4 | 63.6 | 56.4 | — | — | |
| ReLAYear=20232026.05 | 62.4 | 63.6 | — | — | — | |
| CGFormerVisual Encoder=Swin-B, Textual Encoder=BERT2024.05 | 62.28 | 63.01 | — | — | — | |
| LISA-7B(ft)Zero-Shot=false2026.03 | 61.8 | 61.6 | — | — | — | |
| LISA-7BVisual Encoder=SAM-ViT-H, Textual Encoder=Vicuna-7B2025.07 | 61.76 | 61.63 | 54.67 | — | — | |
| LISA-V-7B (ft)Backbone=SAM-ViT-H, Finetuned=true2024.05 | 61.76 | 61.63 | 54.67 | — | — | |
| LISA-Vicuna-7Bfine-tuned=true2025.10 | 61.76 | 61.63 | 54.67 | — | — | |
| LISA-Vicuna-7BBackbone=Vicuna-7B, fine-tuned=true2026.04 | 61.76 | 61.63 | 54.67 | — | — | |
| LISA(FT)Training Data Ratio=100%2026.05 | 61.76 | 61.63 | — | — | 62.9 | |
| LISA(ft)LLM Type=Vicuna-7B, Zero-Shot=false, Fine-tuning=true2024.03 | 61.7 | 63.3 | — | — | — | |
| GSVALLM Type=Vicuna-7B, Zero-Shot=false, Fine-tuning=false2024.03 | 61.7 | 63.3 | — | — | — | |
| GSVA-V-7BBackbone=SAM-ViT-H, Finetuned=false2024.05 | 61.7 | 63.32 | 56.45 | — | — | |
| GSVA-7BType=MLLM-based Segmentation Network, SAM-based=true, Evaluation Protocol=Supervised2024.11 | 61.7 | — | — | — | — | |
| GSVACategory=VLM based, Fine-tuning=false2025.05 | 61.7 | 63.3 | 62.4 | — | — | |
| LISA (ft)Category=VLM based, Fine-tuning=true2025.05 | 61.7 | 63.3 | 56.5 | — | — | |
| GSVA-Vicuna-7Bfine-tuned=false2025.10 | 61.7 | 63.32 | 56.45 | — | — | |
| GSVA-7BZero-Shot=false2026.03 | 61.7 | 63.3 | — | — | — | |
| GSVA-Vicuna-7BBackbone=Vicuna-7B2026.04 | 61.7 | 63.32 | 56.45 | — | — | |
| LISA-7BYear=2024, Backbone=LLaVA-1.52026.05 | 61.7 | 61.6 | — | — | — | |
| LISA-7BBackbone=SAM-ViT-H, External datasets=true2024.11 | 61.63 | 61.76 | 54.67 | — | — | |
| LAVT+RELADecoder=ReLA2023.06 | 61.23 | 61.32 | — | — | — | |
| LAVT+ReLAbase_method=LAVT2026.01 | 61.23 | 61.32 | — | — | — | |
| VisHarnessTraining Data Ratio=0.7%2026.05 | 60.6 | 56.8 | — | — | 63.58 | |
| VLT+RELADecoder=ReLA2023.06 | 58.65 | 59.43 | — | — | — | |
| VLT+ReLAbase_method=VLT2026.01 | 58.65 | 59.43 | — | — | — | |
| LAVTTraining M-Dec.=true2025.12 | 58.4 | — | — | — | — | |
| VisHarness-SFTTraining Data Ratio=0.7%2026.05 | 58.34 | 55.14 | — | — | 62.32 | |
| ReLA†Backbone=Swin-T2024.05 | 57.73 | 56.87 | 44.07 | — | — | |
| LAVTVisual Encoder=Swin-B, Textual Encoder=BERT-B2025.07 | 57.64 | 58.4 | 49.32 | — | — | |
| LAVT2023.06 | 57.64 | 58.4 | — | — | — | |
| LAVTBackbone=Swin-B2024.05 | 57.64 | 58.4 | 49.32 | — | — | |
| LAVTVisual Encoder=Swin-B, Textual Encoder=BERT2024.05 | 57.64 | 58.4 | — | — | — | |
| LAVT2026.01 | 57.64 | 58.4 | — | — | — | |
| LAVT2025.10 | 57.64 | 58.4 | 49.32 | — | — | |
| LAVTBackbone=Swin-B2024.11 | 57.64 | 58.4 | 49.32 | — | — | |
| LAVT2026.04 | 57.64 | 58.4 | 49.32 | — | — | |
| LAVTTraining Data Ratio=100%2026.05 | 57.64 | 58.4 | — | — | 59.7 | |
| LAVTType=Segmentation Specialist, SAM-based=false, Evaluation Protocol=Supervised2024.11 | 57.6 | — | — | — | — | |
| LAVTCategory=Specialist, Fine-tuning=false2025.05 | 57.6 | 58.4 | 49.3 | — | — |