Visual Grounding on Who's Waldo (test)
63.5AccuracyWho's Waldo
Evaluation Results
| Method | Links | |
|---|---|---|
| Who's WaldoTraining Paradigm=Supervised2023.11 | 63.5 | |
| Who's Waldo modelTraining Data=Who's Waldo2021.08 | 63.5 | |
| VR-VLA (Ours+VR-CLIP)Foundation Model=CLIP, Variant=VR-CLIP2023.11 | 61.3 | |
| VR-VLA (Ours)Foundation Model=CLIP2023.11 | 60.8 | |
| VR-VLA (Ours+VR-FLAVA)Foundation Model=FLAVA, Variant=VR-FLAVA2023.11 | 59.8 | |
| VR-VLA (Ours)Foundation Model=FLAVA2023.11 | 59.6 | |
| L→R (Largest)Type=Baseline2021.08 | 57.7 | |
| Big->SmallType=Baseline2021.08 | 48.2 | |
| SL-CCRFTraining Paradigm=Pretrained on grounding data2023.11 | 46.4 | |
| SL-CCRFTraining Data=Flickr30K Entities, Name processing configuration=Constant2021.08 | 46.4 | |
| SL-CCRFTraining Data=Flickr30K Entities, Name processing configuration=Random2021.08 | 44.1 | |
| MAttNetTraining Data=RefCOCOg, Name processing configuration=Random2021.08 | 44 | |
| MAttNetTraining Data=RefCOCOg, Name processing configuration=Full Names2021.08 | 43.6 | |
| SL-CCRFTraining Data=Flickr30K Entities, Name processing configuration=Full Names2021.08 | 43.5 | |
| Gupta et al.Training Data=Flickr30K Entities, Name processing configuration=Random2021.08 | 41.1 | |
| Gupta et al.Training Data=Flickr30K Entities, Name processing configuration=Full Names2021.08 | 39.3 | |
| Gupta et al.Training Data=COCO, Name processing configuration=Random2021.08 | 39.3 | |
| UNITERTraining Data=Multiple [36, 30, 44, 56], Name processing configuration=Random2021.08 | 38.4 | |
| L→R (All)Type=Baseline2021.08 | 38.4 | |
| Gupta et al. (Flickr30K)Training Paradigm=Pretrained on grounding data, Pre-training Dataset=Flickr30K2023.11 | 38.2 | |
| Gupta et al.Training Data=Flickr30K Entities, Name processing configuration=Constant2021.08 | 38.2 | |
| Gupta et al.Training Data=COCO, Name processing configuration=Full Names2021.08 | 36.9 | |
| UNITERTraining Data=Multiple [36, 30, 44, 56], Name processing configuration=Full Names2021.08 | 36.3 | |
| Gupta et al. (COCO)Training Paradigm=Pretrained on grounding data, Pre-training Dataset=COCO2023.11 | 35.6 | |
| Gupta et al.Training Data=COCO, Name processing configuration=Constant2021.08 | 35.6 | |
| UNITERTraining Paradigm=Pretrained on grounding data2023.11 | 34.2 | |
| UNITERTraining Data=Multiple [36, 30, 44, 56], Name processing configuration=Constant2021.08 | 34.2 | |
| RandomType=Baseline2021.08 | 30.9 | |
| ReCLIPFoundation Model=CLIP2023.11 | 29.4 | |
| MAttNetTraining Paradigm=Pretrained on grounding data2023.11 | 24.1 | |
| MAttNetTraining Data=RefCOCOg, Name processing configuration=Constant2021.08 | 24.1 |