Single-object retrieval on CLEVR Cola single-object compounds
91.1mAP (All)FLAVA + MM-Adapter
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FLAVA + MM-AdapterBackbone=FLAVA B-16, Adaptation=Multimodal Adapter2023.05 | 91.1 | 86.64 | 87.39 | |
| FLAVA + MM-PredBackbone=FLAVA B-16, Adaptation=Multimodal Prediction Head2023.05 | 90.43 | 85.78 | 86.07 | |
| CLIP + MM-AdapterBackbone=CLIP (ViT B-32), Adaptation=Multimodal Adapter2023.05 | 88.21 | 89.52 | 77 | |
| FLAVA + FT-lateBackbone=FLAVA B-16, Adaptation=Fine-tuning (Late layers)2023.05 | 77.95 | 72.72 | 66.42 | |
| CLIP + MM-PredBackbone=CLIP (ViT B-32), Adaptation=Multimodal Prediction Head2023.05 | 75.8 | 51.98 | 80.72 | |
| CLIP + FT lateBackbone=CLIP (ViT B-32), Adaptation=Fine-tuning (Late layers)2023.05 | 64.06 | 27.53 | 67.48 | |
| CLIP + FT allBackbone=CLIP (ViT B-32), Adaptation=Fine-tuning (All)2023.05 | 52.32 | 19 | 47.95 | |
| CLIP + LinearBackbone=CLIP (ViT B-32), Adaptation=Linear Probing2023.05 | 47.96 | 29.43 | 46.75 | |
| CLIP + prompt-tuneBackbone=CLIP (ViT B-32), Adaptation=Prompt Tuning2023.05 | 29.61 | 23.17 | 28.05 | |
| FLAVA + LinearBackbone=FLAVA B-16, Adaptation=Linear Probing2023.05 | 19.3 | 17.53 | 18.52 | |
| FLAVABackbone=FLAVA B-16, Adaptation=zero-shot2023.05 | 15.41 | 13.27 | 15.93 | |
| CLIPBackbone=CLIP (ViT B-32), Adaptation=zero-shot2023.05 | 15.38 | 15.01 | 15.32 |