Referring Image Segmentation on G-Ref UMD split (val)
63.49mIoUVLT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VLTVisual Backbone=Swin-B, Textual Encoder=BERT2022.10 | 63.49 | 77.23 | |
| MaILResolution=Fixed aspect ratio2021.11 | 62.45 | — | |
| MaILVisual Backbone=ViLT, Textual Encoder=BERT, large-scale pre-training=true2022.10 | 62.45 | — | |
| LAVTVisual Backbone=Swin-B, Textual Encoder=BERT2022.10 | 61.24 | — | |
| MaILResolution=416x4162021.11 | 60.86 | — | |
| CRISVisual Backbone=CLIP-R101, Textual Encoder=CLIP, large-scale pre-training=true2022.10 | 59.87 | — | |
| VLTVisual Backbone=Darknet53, Textual Encoder=bi-GRU2022.10 | 54.96 | 62.05 | |
| LTS2021.11 | 54.4 | — | |
| LTSVisual Backbone=Darknet53, Textual Encoder=bi-GRU2022.10 | 54.4 | — | |
| VLT2021.11 | 52.99 | — | |
| ISFPVisual Backbone=Darknet53, Textual Encoder=Bi-GRU2022.10 | 52.67 | — | |
| CGAN2021.11 | 51.01 | — | |
| CGANVisual Backbone=DeepLab-R101, Textual Encoder=bi-GRU2022.10 | 51.01 | — | |
| MCN2021.11 | 49.22 | — | |
| MCNVisual Backbone=Darknet53, Textual Encoder=bi-GRU2022.10 | 49.22 | — | |
| MAttNet2021.11 | 47.64 | — | |
| MAttNetVisual Backbone=MaskRCNN-R101, Textual Encoder=bi-LSTM2022.10 | 47.64 | — | |
| CAC2021.11 | 46.37 | — | |
| CACVisual Backbone=ResNet101, Textual Encoder=bi-LSTM2022.10 | 46.37 | — |