Image-to-Text Retrieval on DOCCI (val)
52.78R@1ITO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ITOPre-training Dataset Size=1B, Backbone=ViT-B/16, Training Epochs=10, Evaluation Protocol=Zero-shot2026.03 | 52.78 | 78.2 | 85.72 | |
| CLIPPre-training Dataset Size=1B, Backbone=ViT-B/16, Training Epochs=10, Evaluation Protocol=Zero-shot2026.03 | 52.58 | 76.98 | 84.78 | |
| ITOPre-training Dataset Size=1B, Backbone=ViT-L/16, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 50.94 | 76.56 | 84.36 | |
| ITO sub2Pre-training Dataset Size=1B, Backbone=ViT-B/16, Training Epochs=10, Evaluation Protocol=Zero-shot2026.03 | 50.78 | 76.18 | 83.78 | |
| CLIPPre-training Dataset Size=1B, Backbone=ViT-L/16, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 48.98 | 75.26 | 83.12 | |
| ITO sub2Pre-training Dataset Size=1B, Backbone=ViT-L/16, Training Epochs=1, Evaluation Protocol=Zero-shot2026.03 | 48.34 | 75.02 | 82.68 | |
| ITO sub2Pre-training Dataset Size=1B, Evaluation Protocol=Zero-shot2026.03 | 44.08 | 70.86 | 79.56 | |
| ITOPre-training Dataset Size=1B, Evaluation Protocol=Zero-shot2026.03 | 43.24 | 69.98 | 79.26 | |
| CLIPPre-training Dataset Size=1B, Evaluation Protocol=Zero-shot2026.03 | 43.02 | 69.48 | 77.88 | |
| ITOPre-training Dataset Size=100M, Evaluation Protocol=Zero-shot2026.03 | 41.54 | 67.48 | 76.52 | |
| CLIPPre-training Dataset Size=100M, Evaluation Protocol=Zero-shot2026.03 | 39.28 | 65.3 | 74.68 | |
| ITO sub2Pre-training Dataset Size=12M, Evaluation Protocol=Zero-shot2026.03 | 28.26 | 53.92 | 64.46 | |
| ITO_sub2Pre-training Dataset=CC3M-recap, Zero-shot=true, Vision Encoder=ViT-B/16, Training Epochs=30, Text Views=22026.03 | 27.82 | 54.14 | 65.9 | |
| ITO_sub3Pre-training Dataset=CC3M-recap, Zero-shot=true, Vision Encoder=ViT-B/16, Training Epochs=30, Text Views=32026.03 | 27.54 | 53.68 | 65.3 | |
| ITOPre-training Dataset Size=12M, Evaluation Protocol=Zero-shot2026.03 | 26.62 | 51 | 61.88 | |
| SigLIPPre-training Dataset Size=12M, Evaluation Protocol=Zero-shot2026.03 | 25 | 49.66 | 61.72 | |
| FLAIRPre-training Dataset Size=12M, Evaluation Protocol=Zero-shot2026.03 | 24.24 | 48.5 | 59.12 | |
| FLAIRPre-training Dataset=CC3M-recap, Zero-shot=true, Vision Encoder=ViT-B/16, Training Epochs=302026.03 | 20.16 | 43.56 | 54.66 | |
| CLIPPre-training Dataset Size=12M, Evaluation Protocol=Zero-shot2026.03 | 20.14 | 43.4 | 53.54 | |
| ITO sub2Pre-training Dataset Size=15M, Evaluation Protocol=Zero-shot2026.03 | 19.82 | 43.06 | 53.7 | |
| ITOPre-training Dataset Size=15M, Evaluation Protocol=Zero-shot2026.03 | 19.06 | 40.28 | 51.9 | |
| CLIPPre-training Dataset Size=15M, Evaluation Protocol=Zero-shot2026.03 | 15.94 | 35.26 | 45.7 | |
| ITO sub2Pre-training Dataset Size=3M, Evaluation Protocol=Zero-shot2026.03 | 9.18 | 22.74 | 31.2 | |
| ITOPre-training Dataset Size=3M, Evaluation Protocol=Zero-shot2026.03 | 8.24 | 22 | 31.64 | |
| FLAIRPre-training Dataset Size=3M, Evaluation Protocol=Zero-shot2026.03 | 7.12 | 19.12 | 28 | |
| SigLIPPre-training Dataset Size=3M, Evaluation Protocol=Zero-shot2026.03 | 4.98 | 14.38 | 20.88 | |
| CLIPPre-training Dataset Size=3M, Evaluation Protocol=Zero-shot2026.03 | 4.1 | 12.56 | 18.72 |