Referring Image Segmentation on RefCOCOg UMD (test)
74.3mIoUVersaViT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VersaViTtraining=Fine-tuning2026.02 | 74.3 | — | |
| LISA-7Btraining=Fine-tuning, parameters=7B2026.02 | 68.5 | — | |
| OracleBackbone=ResNet-50, Segmentor=true2024.10 | 68.4 | — | |
| VISA-7Btraining=Fine-tuning, parameters=7B2026.02 | 66.4 | — | |
| ReLAtraining=Fine-tuning2026.02 | 66 | — | |
| LAVT+Backbone=Swin-Base2024.10 | 63.6 | — | |
| LAVTtraining=Fine-tuning2026.02 | 62.1 | — | |
| PCNet_SBackbone=ResNet-50, Segmentor=true2024.10 | 46.9 | — | |
| TRISBackbone=ResNet-50, Segmentor=true2024.10 | 39.9 | — | |
| CLIPBackbone=ResNet-50, Segmentor=true2024.10 | 37.8 | — | |
| PCNet_SBackbone=ResNet-50, Segmentor=false2024.10 | 30.6 | 57.4 | |
| PCNet_FBackbone=ResNet-50, Segmentor=false2024.10 | 30.2 | 57.2 | |
| TRISBackbone=ResNet-50, Segmentor=false2024.10 | 27.3 | 53.3 | |
| WWbLBackbone=VGG16, Segmentor=false2024.10 | 21.8 | 31.4 | |
| GroupViTBackbone=Group ViT, Segmentor=false2024.10 | 20.1 | 31 | |
| CLIP-ESBackbone=ViT-Base, Segmentor=false2024.10 | 14.1 | 45.8 |