Referring Expression Comprehension on RefCOCOg UMD (val)
83.35AccuracyMDETR (Supervised SOTA)
Evaluation Results
| Method | Links | |
|---|---|---|
| MDETR (Supervised SOTA)evaluation_protocol=Supervised, backbone=EfficientNet-B3, proposals=N/A2022.04 | 83.35 | |
| ReCLIPbackbone=CLIP (RN50x16 + ViT-B/32), object_size_prior=true, proposals=MAttNet2022.04 | 60.85 | |
| ReCLIPbackbone=CLIP (RN50x16 + ViT-B/32), object_size_prior=false, proposals=MAttNet2022.04 | 59.33 | |
| ReCLIP w/o relationsbackbone=CLIP (RN50x16 + ViT-B/32), object_size_prior=true, proposals=MAttNet2022.04 | 59.19 | |
| ReCLIP w/o relationsbackbone=CLIP (RN50x16 + ViT-B/32), object_size_prior=false, proposals=MAttNet2022.04 | 57.7 | |
| GradCAMbackbone=CLIP (RN50x16 + ViT-B/32), object_size_prior=true, proposals=MAttNet2022.04 | 52.29 | |
| GradCAMbackbone=CLIP (RN50x16 + ViT-B/32), object_size_prior=false, proposals=MAttNet2022.04 | 50.86 | |
| CPT-Seg w/ VinVLevaluation_protocol=Zero-shot, backbone=VinVL, proposals=Mask-RCNN2022.04 | 36.7 | |
| CPT-Blk w/ VinVLevaluation_protocol=Zero-shot, backbone=VinVL, proposals=MAttNet2022.04 | 32.1 | |
| CPT-adaptedbackbone=CLIP (RN50x16 + ViT-B/32), object_size_prior=true, proposals=MAttNet2022.04 | 28.98 | |
| CPT-adaptedbackbone=CLIP (RN50x16 + ViT-B/32), object_size_prior=false, proposals=MAttNet2022.04 | 22.32 | |
| Randomevaluation_protocol=Zero-shot2022.04 | 18.12 |