Composed Image Retrieval on Fashion-IQ synthetic triplet datasets (test)
39.1Recall@10CoLLM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CoLLMVision Encoder=BLIP-L/16, Resolution=384x384, Training Dataset=MTCIR (ours), Fine-tuning=COCO2025.03 | 39.1 | 60.7 | |
| CoVR2Vision Encoder=EVA-CLIP ViT-G/14, Resolution=364x364, Training Dataset=WV-CC-COVIR2025.03 | 38.2 | 58.4 | |
| MagicLensVision Encoder=CoCa-L/18, Resolution=288x288, Training Dataset=MagicLens2025.03 | 38.1 | 58.3 | |
| CompoDiffVision Encoder=OpenAI CLIP-L/14, Resolution=224x224, Training Dataset=SynTrip18M2025.03 | 36 | 48.6 | |
| CoLLMVision Encoder=OpenAI CLIP-L/14, Resolution=224x224, Training Dataset=MTCIR (ours)2025.03 | 32.9 | 54.2 | |
| MagicLensVision Encoder=OpenAI CLIP-L/14, Resolution=224x224, Training Dataset=MagicLens2025.03 | 30.7 | 52.5 | |
| Omkar et al.Vision Encoder=BLIP-L/16, Resolution=384x384, Training Dataset=WebCoVR, Fine-tuning=COCO2025.03 | 30.3 | 46.5 |