Single-object retrieval on GQA Cola single-object compounds
48.54mAP (All)FLAVA + MM-Adapter
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FLAVA + MM-AdapterBackbone=FLAVA B-16, Adaptation=Multimodal Adapter2023.05 | 48.54 | 52.55 | 44.91 | |
| FLAVA + MM-PredBackbone=FLAVA B-16, Adaptation=Multimodal Prediction Head2023.05 | 47.12 | 51.53 | 43.13 | |
| CLIP + MM-AdapterBackbone=CLIP (ViT B-32), Adaptation=Multimodal Adapter2023.05 | 46.83 | 48.86 | 44.99 | |
| CLIP + MM-PredBackbone=CLIP (ViT B-32), Adaptation=Multimodal Prediction Head2023.05 | 45.99 | 48.6 | 43.64 | |
| CLIP + FT lateBackbone=CLIP (ViT B-32), Adaptation=Fine-tuning (Late layers)2023.05 | 42.19 | 44.61 | 40.01 | |
| CLIP + LinearBackbone=CLIP (ViT B-32), Adaptation=Linear Probing2023.05 | 40.44 | 42.87 | 38.24 | |
| FLAVABackbone=FLAVA B-16, Adaptation=zero-shot2023.05 | 39.65 | 42.18 | 37.37 | |
| FLAVA + FT-lateBackbone=FLAVA B-16, Adaptation=Fine-tuning (Late layers)2023.05 | 39.58 | 42.26 | 37.16 | |
| CLIP + FT allBackbone=CLIP (ViT B-32), Adaptation=Fine-tuning (All)2023.05 | 38.81 | 40.85 | 36.95 | |
| CLIP + prompt-tuneBackbone=CLIP (ViT B-32), Adaptation=Prompt Tuning2023.05 | 37.4 | 40.69 | 34.43 | |
| FLAVA + LinearBackbone=FLAVA B-16, Adaptation=Linear Probing2023.05 | 37.07 | 39.96 | 34.46 | |
| CLIPBackbone=CLIP (ViT B-32), Adaptation=zero-shot2023.05 | 36.53 | 39.06 | 34.24 |