Referring Image Segmentation on RefCOCOg UMD (val)
79.7mIoUSa2VA-26B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Sa2VA-26Btraining=Fine-tuning, parameters=26B2026.02 | 79.7 | — | |
| VersaViTtraining=Fine-tuning2026.02 | 72 | — | |
| OracleBackbone=ResNet-50, Segmentor=true2024.10 | 68.3 | — | |
| LISA-7Btraining=Fine-tuning, parameters=7B2026.02 | 66.4 | — | |
| VISA-7Btraining=Fine-tuning, parameters=7B2026.02 | 65.5 | — | |
| ReLAtraining=Fine-tuning2026.02 | 65 | — | |
| LAVT+Backbone=Swin-Base2024.10 | 63.3 | — | |
| LAVTtraining=Fine-tuning2026.02 | 61.2 | — | |
| PCNet_SBackbone=ResNet-50, Segmentor=true2024.10 | 46.8 | — | |
| TRISBackbone=ResNet-50, Segmentor=true2024.10 | 39 | — | |
| CLIPBackbone=ResNet-50, Segmentor=true2024.10 | 37.4 | — | |
| PCNet_SBackbone=ResNet-50, Segmentor=false2024.10 | 30 | 57.9 | |
| PCNet_FBackbone=ResNet-50, Segmentor=false2024.10 | 29.7 | 57 | |
| TRISBackbone=ResNet-50, Segmentor=false2024.10 | 26.6 | 51.9 | |
| WWbLBackbone=VGG16, Segmentor=false2024.10 | 21.8 | 32.1 | |
| GroupViTBackbone=Group ViT, Segmentor=false2024.10 | 19.8 | 30.9 | |
| CLIP-ESBackbone=ViT-Base, Segmentor=false2024.10 | 13.9 | 46.2 |