Referring Expression Segmentation on G-Ref Google (val)
66.89mIoUReLA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ReLAVisual Encoder=Swin-B, Textual Encoder=BERT, Metric Mode=mIoU2026.01 | 66.89 | — | — | |
| VLT2021.08 | 49.76 | — | 56.65 | |
| LSCM2021.08 | 48.05 | — | — | |
| BRINet2021.08 | 48.04 | — | — | |
| CGAN2021.08 | 46.54 | — | — | |
| CMSA2021.08 | 39.98 | — | — | |
| CMPC2021.08 | 39.98 | — | — | |
| DMN2021.08 | 36.76 | — | — | |
| RRN2021.08 | 36.45 | — | — | |
| BUSNetVisual Encoder=Deeplab-101, Textual Encoder=Self-Att2026.01 | — | 50.56 | — | |
| CMPC+Visual Encoder=Deeplab-101, Textual Encoder=LSTM2026.01 | — | 49.89 | — | |
| EFNVisual Encoder=ResNet101, Textual Encoder=GRU2026.01 | — | 51.93 | — | |
| LAVTVisual Encoder=Swin-B, Textual Encoder=BERT2026.01 | — | 60.5 | — | |
| ReLAVisual Encoder=Swin-B, Textual Encoder=BERT, Metric Mode=cIoU2026.01 | — | 62.7 | — | |
| ReSTRVisual Encoder=ViT-B, Textual Encoder=Transformer2026.01 | — | 54.48 | — | |
| VLTVisual Encoder=Darknet53, Textual Encoder=GRU2026.01 | — | 52.02 | — | |
| VLT+Visual Encoder=Swin-B, Textual Encoder=BERT2026.01 | — | 62.8 | — |