Image-to-Text Retrieval on FMB (test)
10.5Recall@1T-CLIP
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| T-CLIPContext=Global2026.05 | 10.5 | 36.2 | 53.9 | 76.2 | 87.1 | 95.8 | |
| Global LoRA2026.05 | 10.4 | 34.2 | 49.6 | 73.1 | 86.6 | 95.6 | |
| T-CLIPContext=Dual2026.05 | 9.8 | 34.2 | 53.7 | 77.1 | 89.5 | 97.3 | |
| DeCLIPContext=Global2026.05 | 9.5 | 26.8 | 40 | 57.3 | 70.4 | 83.4 | |
| CLIP-AdapterContext=Global2026.05 | 7.5 | 26.6 | 40.9 | 60.5 | 76.8 | 90.5 | |
| CLIPContext=Global2026.05 | 4.3 | 11.8 | 17.5 | 31.8 | 44.3 | 63.2 | |
| T-CLIPContext=Fine-grained2026.05 | 4.2 | 15.1 | 24.5 | 41.3 | 58 | 78.8 | |
| DeCLIPContext=Fine-grained2026.05 | 4.1 | 14.5 | 23.8 | 40.2 | 56.1 | 74.3 | |
| F-G LoRA2026.05 | 3.7 | 13.3 | 24.8 | 47.9 | 65.8 | 84.2 | |
| CLIP-AdapterContext=Fine-grained2026.05 | 2.9 | 15.7 | 27.7 | 45.5 | 67.7 | 88 | |
| CLIPContext=Fine-grained2026.05 | 1.1 | 8.2 | 14.3 | 22.5 | 27.9 | 53.2 |