Multi-modal Retrieval (Image-Text to Text/Image-Text) on OVEN QS
8.39Recall@5VISTA
Evaluation Results
| Method | Links | |
|---|---|---|
| VISTA#Params=196M, Zero-shot=true2024.06 | 8.39 | |
| CLIP#Params=149M, Zero-shot=true, Multi-modal Training (Generated Data)=false2024.06 | 1.06 | |
| Pic2Word#Params=224M, Zero-shot=true, Multi-modal Training (Generated Data)=false2024.06 | 0.97 | |
| Pic2Word-MM#Params=224M, Zero-shot=true, Multi-modal Training (Generated Data)=true2024.06 | 0.82 | |
| CLIP-MM#Params=149M, Zero-shot=true, Multi-modal Training (Generated Data)=true2024.06 | 0.4 | |
| BLIP-MM#Params=224M, Zero-shot=true, Multi-modal Training (Generated Data)=true2024.06 | 0.27 | |
| BLIP#Params=224M, Zero-shot=true, Multi-modal Training (Generated Data)=false2024.06 | 0.06 |