Contextual Image Retrieval on VIST
3,120R@1V-Retrver-7B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| V-Retrver-7BZero-shot=true, Query format=(q_i + q_t) -> c_i2026.02 | 3,120 | — | — | |
| LamRA-7BZero-shot=true, Query format=(q_i + q_t) -> c_i2026.02 | 2,860 | — | — | |
| MM-Embed-7BZero-shot=true, Query format=(q_i + q_t) -> c_i2026.02 | 2,570 | — | — | |
| E5-VZero-shot=true, Query format=(q_i + q_t) -> c_i2026.02 | 1,000 | — | — | |
| MagicLens-LZero-shot=true, Query format=(q_i + q_t) -> c_i2026.02 | 330 | — | — | |
| CLIP-LZero-shot=true, Query format=(q_i + q_t) -> c_i2026.02 | 60 | — | — | |
| UniIR-CLIPZero-shot=true, Query format=(q_i + q_t) -> c_i2026.02 | 60 | — | — | |
| GILLInput context=5 captions, 4 images2023.05 | 20.3 | 45 | 53.7 | |
| FROMAGeInput context=5 captions, 4 images2023.05 | 18.2 | 42.7 | 51.8 | |
| CLIP ViT-LInput context=5 captions, 4 images2023.05 | 8.8 | 22.3 | 29.8 |