Multi-modal retrieval (Image-Text to Text) on ReMuQ
84.73Recall@5VISTA
Evaluation Results
| Method | Links | |
|---|---|---|
| VISTA#Params=196M, Zero-shot=true2024.06 | 84.73 | |
| Pic2Word-MM#Params=224M, Zero-shot=true, Multi-modal Training (Generated Data)=true2024.06 | 78.09 | |
| Pic2Word#Params=224M, Zero-shot=true, Multi-modal Training (Generated Data)=false2024.06 | 68.99 | |
| CLIP#Params=149M, Zero-shot=true, Multi-modal Training (Generated Data)=false2024.06 | 65.05 | |
| CLIP-MM#Params=149M, Zero-shot=true, Multi-modal Training (Generated Data)=true2024.06 | 58.86 | |
| BLIP-MM#Params=224M, Zero-shot=true, Multi-modal Training (Generated Data)=true2024.06 | 55.66 | |
| BLIP#Params=224M, Zero-shot=true, Multi-modal Training (Generated Data)=false2024.06 | 1.25 |