Image-to-Text Compositional Reasoning on SugarCrepe++ ITT
73.1AccuracyReasonSigLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| ReasonSigLIPViT=So/14, Resolution=384, Data=+58M2026.06 | 73.1 | |
| READ-CLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 69.8 | |
| ReasonCLIP + READViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 69.2 | |
| SigLIPViT=So/14, Resolution=384, Data=10.0B2026.06 | 67.9 | |
| SigLIP2ViT=G/16, Resolution=384, Data=10.0B2026.06 | 67.4 | |
| ReasonSigLIP2ViT=G/16, Resolution=384, Data=+58M2026.06 | 67 | |
| SigLIP2ViT=L/16, Resolution=384, Data=10.0B2026.06 | 65.7 | |
| NegCLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 65 | |
| MetaCLIPViT=L/14, Resolution=224, Data=2.5B2026.06 | 64.4 | |
| ReasonCLIPViT=L/14, Resolution=336, Data=+58M2026.06 | 63.8 | |
| Eva-CLIP-02ViT=L/14, Resolution=224, Data=2.0B2026.06 | 63.3 | |
| ReasonCLIPViT=L/14, Resolution=224, Data=+58M2026.06 | 63.1 | |
| Triplet-CLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 61.7 | |
| ReasonCLIPViT=B/32, Resolution=224, Data=+58M2026.06 | 61.5 | |
| CLIPViT=L/14, Resolution=224, Data=0.4B2026.06 | 60.6 | |
| CLIPViT=L/14, Resolution=336, Data=0.4B2026.06 | 60.6 | |
| GNM-CLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 60.2 | |
| CLIPViT=B/32, Resolution=224, Data=0.4B2026.06 | 60 | |
| Long-CLIPViT=L/14, Resolution=224, Data=0.4B2026.06 | 59.8 | |
| MetaCLIPViT=B/32, Resolution=224, Data=0.4B2026.06 | 58.1 | |
| CE-CLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 55.7 |