Referring Image Segmentation on G-Ref Google split (val)
65.79IoUCGFormer
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CGFormer2023.09 | 65.79 | — | 62.51 | |
| VLT [6]Visual Encoder=Swin-B, Textual Encoder=BERT2023.06 | 62.8 | — | — | |
| VLTVisual Backbone=Swin-B, Textual Encoder=BERT2022.10 | 62.8 | 73.84 | — | |
| ReLAVisual Encoder=Swin-B, Textual Encoder=BERT2023.06 | 62.7 | — | — | |
| MaILResolution=Fixed aspect ratio2021.11 | 61.81 | — | — | |
| MaILVisual Backbone=ViLT, Textual Encoder=BERT, large-scale pre-training=true2022.10 | 61.81 | — | — | |
| LAVTLanguage Model=BERT2021.12 | 60.5 | — | — | |
| LAVTVisual Encoder=Swin-B, Textual Encoder=BERT2023.06 | 60.5 | — | — | |
| LAVTVisual Backbone=Swin-B, Textual Encoder=BERT2022.10 | 60.5 | — | — | |
| CRIS2023.09 | 60.36 | — | — | |
| MaILResolution=416x4162021.11 | 60.26 | — | — | |
| ReSTRVisual Encoder=ViT-B, Textual Encoder=Transformer2023.06 | 54.48 | — | — | |
| ReSTRVisual Backbone=ViT-B, Textual Encoder=Transformer2022.10 | 54.48 | — | — | |
| VLT [5]Visual Encoder=Darknet53, Textual Encoder=bi-GRU2023.06 | 52.02 | — | — | |
| VLTVisual Backbone=Darknet53, Textual Encoder=bi-GRU2022.10 | 52.02 | 57.88 | — | |
| EFN2021.11 | 51.93 | — | — | |
| EFNLanguage Model=Bi-GRU2021.12 | 51.93 | — | — | |
| EFNVisual Backbone=ResNet101, Textual Encoder=bi-GRU2022.10 | 51.93 | — | — | |
| BUSNetLanguage Model=Self-Att2021.12 | 50.56 | — | — | |
| BUSNetVisual Backbone=DeepLab-R101, Textual Encoder=Self-Att2022.10 | 50.56 | — | — | |
| ISFPVisual Backbone=Darknet53, Textual Encoder=Bi-GRU2022.10 | 50.08 | — | — | |
| BUSNet2021.11 | 49.98 | — | — | |
| CMPC+Language Model=LSTM2021.12 | 49.89 | — | — | |
| CMPC+Visual Backbone=DeepLab-R101, Textual Encoder=LSTM2022.10 | 49.89 | — | — | |
| VLT2021.11 | 49.76 | — | — | |
| VLTLanguage Model=Bi-GRU2021.12 | 49.76 | — | — | |
| VLT2023.09 | 49.76 | — | — | |
| CMPCLanguage Model=LSTM2021.12 | 49.05 | — | — | |
| JRNet2021.11 | 48.95 | — | — | |
| LSCM2021.11 | 48.05 | — | — | |
| LSCMLanguage Model=LSTM2021.12 | 48.05 | — | — | |
| LSCMVisual Backbone=DeepLab-R101, Textual Encoder=LSTM2022.10 | 48.05 | — | — | |
| BRINet2021.11 | 48.04 | — | — | |
| BRINetLanguage Model=LSTM2021.12 | 48.04 | — | — | |
| BRINetVisual Backbone=DeepLab-R101, Textual Encoder=LSTM2022.10 | 48.04 | — | — | |
| CGAN2021.11 | 46.54 | — | — | |
| CGANLanguage Model=Bi-GRU2021.12 | 46.54 | — | — | |
| CGAN2023.09 | 46.54 | — | — | |
| CGANVisual Backbone=DeepLab-R101, Textual Encoder=bi-GRU2022.10 | 46.54 | — | — | |
| STEP2021.11 | 46.4 | — | — | |
| STEPLanguage Model=Bi-LSTM2021.12 | 46.4 | — | — | |
| STEPVisual Backbone=DeepLab-R101, Textual Encoder=bi-LSTM2022.10 | 46.4 | — | — | |
| CAC2021.11 | 44.32 | — | — | |
| CACLanguage Model=Bi-LSTM2021.12 | 44.32 | — | — | |
| CACVisual Backbone=ResNet101, Textual Encoder=bi-LSTM2022.10 | 44.32 | — | — | |
| ASGN2021.11 | 41.36 | — | — | |
| CMSA2021.11 | 39.98 | — | — | |
| CMPC2021.11 | 39.98 | — | — | |
| CMSALanguage Model=None2021.12 | 39.98 | — | — | |
| CMSAVisual Backbone=DeepLab-R101, Textual Encoder=None2022.10 | 39.98 | — | — | |
| CMPCVisual Backbone=DeepLab-R101, Textual Encoder=LSTM2022.10 | 39.98 | — | — | |
| DMN2021.11 | 36.76 | — | — | |
| DMNLanguage Model=SRU2021.12 | 36.76 | — | — | |
| DMNVisual Backbone=DPN92, Textual Encoder=SRU2022.10 | 36.76 | — | — | |
| RRN2021.11 | 36.45 | — | — | |
| RRNLanguage Model=LSTM2021.12 | 36.45 | — | — | |
| RRNVisual Backbone=DeepLab-R101, Textual Encoder=LSTM2022.10 | 36.45 | — | — | |
| RMI2021.11 | 34.52 | — | — | |
| BUSNet2023.09 | — | — | 50.56 | |
| CMPC2023.09 | — | — | 49.05 | |
| CMSA2023.09 | — | — | 39.98 | |
| LAVT2023.09 | — | — | 60.5 | |
| LSCM2023.09 | — | — | 48.05 | |
| RRN2023.09 | — | — | 36.45 |