Single-object retrieval on PACO Cola single-object compounds
19.36mAP (All)FLAVA + MM-Adapter
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FLAVA + MM-AdapterBackbone=FLAVA B-16, Adaptation=Multimodal Adapter2023.05 | 19.36 | 11.16 | 27.55 | |
| FLAVA + MM-PredBackbone=FLAVA B-16, Adaptation=Multimodal Prediction Head2023.05 | 18.57 | 10.71 | 26.44 | |
| CLIP + MM-AdapterBackbone=CLIP (ViT B-32), Adaptation=Multimodal Adapter2023.05 | 18.56 | 11.47 | 25.66 | |
| CLIP + FT lateBackbone=CLIP (ViT B-32), Adaptation=Fine-tuning (Late layers)2023.05 | 15.66 | 8.74 | 22.58 | |
| CLIP + MM-PredBackbone=CLIP (ViT B-32), Adaptation=Multimodal Prediction Head2023.05 | 15.49 | 8 | 22.94 | |
| CLIP + FT allBackbone=CLIP (ViT B-32), Adaptation=Fine-tuning (All)2023.05 | 14.58 | 6.49 | 22.66 | |
| CLIP + LinearBackbone=CLIP (ViT B-32), Adaptation=Linear Probing2023.05 | 14.22 | 6.75 | 21.68 | |
| FLAVA + FT-lateBackbone=FLAVA B-16, Adaptation=Fine-tuning (Late layers)2023.05 | 12.82 | 5.79 | 19.84 | |
| CLIP + prompt-tuneBackbone=CLIP (ViT B-32), Adaptation=Prompt Tuning2023.05 | 12.76 | 5.92 | 19.61 | |
| FLAVABackbone=FLAVA B-16, Adaptation=zero-shot2023.05 | 12.53 | 7.29 | 17.76 | |
| CLIPBackbone=CLIP (ViT B-32), Adaptation=zero-shot2023.05 | 12.21 | 8.64 | 15.79 | |
| FLAVA + LinearBackbone=FLAVA B-16, Adaptation=Linear Probing2023.05 | 11.65 | 7.9 | 15.39 |