Text-to-Image Retrieval on FMB (test)
10.4R@1T-CLIP
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| T-CLIPContext=Dual2026.05 | 10.4 | 39.5 | 58.7 | 81.8 | 91.4 | 97.9 | |
| T-CLIPContext=Global2026.05 | 10.1 | 38.5 | 55.6 | 78.7 | 90.1 | 97 | |
| Global LoRA2026.05 | 10 | 35 | 51 | 73.7 | 88.2 | 96 | |
| DeCLIPContext=Global2026.05 | 7.7 | 27.7 | 37 | 58.6 | 70 | 84.3 | |
| CLIP-AdapterContext=Global2026.05 | 6.3 | 25.9 | 40.2 | 61.3 | 77.5 | 92.7 | |
| F-G LoRA2026.05 | 4.8 | 18.5 | 28.2 | 48.9 | 66.6 | 84.8 | |
| CLIP-AdapterContext=Fine-grained2026.05 | 3.9 | 14.8 | 24.3 | 43.8 | 61.1 | 86.3 | |
| T-CLIPContext=Fine-grained2026.05 | 3.9 | 14.4 | 21.9 | 34.6 | 52.6 | 70.8 | |
| DeCLIPContext=Fine-grained2026.05 | 3.8 | 13.6 | 23.9 | 40 | 56.6 | 75.4 | |
| CLIPContext=Global2026.05 | 1.8 | 7.1 | 14.3 | 24.3 | 41.8 | 61.8 | |
| CLIPContext=Fine-grained2026.05 | 0.4 | 3.2 | 6.8 | 15.7 | 28.9 | 47.9 |