Text-to-Image Retrieval on XTD10 (test)
93.3R@10Ours-stage3
Evaluation Results
| Method | Links | |
|---|---|---|
| Ours-stage3Training Configuration=Full three-stage model including NLU2026.01 | 93.3 | |
| Jina-Clip-v22026.01 | 92.2 | |
| XLM-R LargeBackbone=ViT-B/16+2026.01 | 91.9 | |
| XLM-R LargeBackbone=ViT-L/142026.01 | 89.1 | |
| XLM-R LargeBackbone=ViT-B/322026.01 | 87.9 | |
| LaBSEBackbone=ViT-L/142026.01 | 87.2 | |
| SigLIP22026.01 | 83.4 |