Text-to-Image Retrieval on DOCCI (val)
17.79Recall@1ITO sub2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ITO sub2Pre-training Dataset Size=1B, Backbone=ViT-B/16, Training Epochs=10, Evaluation Protocol=Zero-shot2026.03 | 17.79 | 32.73 | 39.9 | |
| ITOPre-training Dataset Size=1B, Backbone=ViT-B/16, Training Epochs=10, Evaluation Protocol=Zero-shot2026.03 | 17.3 | 31.6 | 38.3 | |
| ITOPre-training Dataset Size=1B, Backbone=ViT-L/16, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 16.77 | 30.75 | 37.6 | |
| ITO sub2Pre-training Dataset Size=1B, Backbone=ViT-L/16, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 16.67 | 30.95 | 38.01 | |
| CLIPPre-training Dataset Size=1B, Backbone=ViT-B/16, Training Epochs=10, Evaluation Protocol=Zero-shot2026.03 | 16.66 | 30.49 | 37.09 | |
| CLIPPre-training Dataset Size=1B, Backbone=ViT-L/16, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 15.59 | 29.16 | 35.49 | |
| ITO sub2Pre-training Dataset Size=1B, Evaluation Protocol=Zero-shot2026.03 | 14.47 | 28.31 | 35.01 | |
| ITOPre-training Dataset Size=1B, Evaluation Protocol=Zero-shot2026.03 | 13.75 | 26.78 | 33.27 | |
| ITOPre-training Dataset Size=100M, Evaluation Protocol=Zero-shot2026.03 | 13.68 | 26.48 | 32.8 | |
| CLIPPre-training Dataset Size=100M, Evaluation Protocol=Zero-shot2026.03 | 13.04 | 25.45 | 31.81 | |
| CLIPPre-training Dataset Size=1B, Evaluation Protocol=Zero-shot2026.03 | 13.01 | 25.71 | 32.28 | |
| ITO sub2Pre-training Dataset Size=12M, Evaluation Protocol=Zero-shot2026.03 | 10.86 | 23.6 | 30.44 | |
| ITO_sub2Pre-training Dataset=CC3M-recap, Zero-shot=true, Vision Encoder=ViT-B/16, Training Epochs=30, Text Views=22026.03 | 10.7 | 23.69 | 30.84 | |
| ITO_sub3Pre-training Dataset=CC3M-recap, Zero-shot=true, Vision Encoder=ViT-B/16, Training Epochs=30, Text Views=32026.03 | 10.68 | 24.04 | 31.27 | |
| FLAIRPre-training Dataset=CC3M-recap, Zero-shot=true, Vision Encoder=ViT-B/16, Training Epochs=302026.03 | 10.65 | 24.23 | 31.6 | |
| ITOPre-training Dataset Size=12M, Evaluation Protocol=Zero-shot2026.03 | 9.39 | 20.51 | 26.92 | |
| SigLIPPre-training Dataset Size=12M, Evaluation Protocol=Zero-shot2026.03 | 9.38 | 20.59 | 26.94 | |
| FLAIRPre-training Dataset Size=12M, Evaluation Protocol=Zero-shot2026.03 | 9.36 | 21.2 | 28.11 | |
| CLIPPre-training Dataset Size=12M, Evaluation Protocol=Zero-shot2026.03 | 7.67 | 17.96 | 24.03 | |
| ITO sub2Pre-training Dataset Size=15M, Evaluation Protocol=Zero-shot2026.03 | 6.86 | 17.52 | 23.6 | |
| ITOPre-training Dataset Size=15M, Evaluation Protocol=Zero-shot2026.03 | 6.82 | 16.45 | 22.45 | |
| CLIPPre-training Dataset Size=15M, Evaluation Protocol=Zero-shot2026.03 | 5.45 | 13.54 | 18.81 | |
| ITO sub2Pre-training Dataset Size=3M, Evaluation Protocol=Zero-shot2026.03 | 3.49 | 9.96 | 14.41 | |
| ITOPre-training Dataset Size=3M, Evaluation Protocol=Zero-shot2026.03 | 3.48 | 9.97 | 14.39 | |
| FLAIRPre-training Dataset Size=3M, Evaluation Protocol=Zero-shot2026.03 | 3.23 | 9.7 | 14.13 | |
| SigLIPPre-training Dataset Size=3M, Evaluation Protocol=Zero-shot2026.03 | 2.28 | 6.91 | 10.32 | |
| CLIPPre-training Dataset Size=3M, Evaluation Protocol=Zero-shot2026.03 | 2.13 | 6.71 | 10.07 |