Referring Image Segmentation on gRefCOCO (testA)
72.79gIoUSSP-SAM
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SSP-SAMModel architecture=SAM based, Input resolution=3362026.03 | 72.79 | — | 70.86 | 65.08 | |
| SSP-SAMModel architecture=SAM based, Input resolution=2242026.03 | 71.79 | — | 68.97 | 69.23 | |
| GSVA-Vicuna-7BModel architecture=SAM based, Fine-tuning=true2026.03 | 71.08 | — | 69.93 | 65.31 | |
| CGFormerModel architecture=Non-SAM based2026.03 | 70.13 | — | 68.15 | — | |
| GSVA-Vicuna-7BModel architecture=SAM based, Fine-tuning=false2026.03 | 70.11 | — | 69.23 | 63.5 | |
| ReLAModel architecture=Non-SAM based2026.03 | 70.03 | — | 69.26 | 59.02 | |
| LISA-Vicuna-7BModel architecture=SAM based, Fine-tuning=true2026.03 | 66.27 | — | 68.5 | 50.01 | |
| LAVTModel architecture=Non-SAM based2026.03 | 65.9 | — | 65.32 | 49.25 | |
| CRISModel architecture=Non-SAM based2026.03 | 63.42 | — | 63.82 | — | |
| VLTModel architecture=Non-SAM based2026.03 | 63.2 | — | 62.19 | 48.74 | |
| LTSModel architecture=Non-SAM based2026.03 | 62.64 | — | 61.87 | — | |
| MattNetModel architecture=Non-SAM based2026.03 | 59.3 | — | 58.66 | 44.04 | |
| LISA-Vicuna-7BModel architecture=SAM based, Fine-tuning=false2026.03 | 48.54 | — | 52.55 | 6.37 | |
| GSVA-7BBackbone=ViT-H2025.12 | — | 69.93 | — | — | |
| LAVTBackbone=Swin-B2025.12 | — | 65.32 | — | — | |
| LISA-7BBackbone=ViT-H2025.12 | — | 68.5 | — | — | |
| OmniSegNetBackbone=Swin-B2025.12 | — | 70.98 | — | — | |
| ReLABackbone=Swin-B2025.12 | — | 69.26 | — | — |