Text-to-Image Compositional Reasoning on SugarCrepe++ TOT
72.9AccuracyReasonSigLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| ReasonSigLIPViT=So/14, Resolution=384, Data=+58M2026.06 | 72.9 | |
| ReasonCLIP + READViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 67 | |
| ReasonSigLIP2ViT=G/16, Resolution=384, Data=+58M2026.06 | 66.9 | |
| READ-CLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 66.2 | |
| NegCLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 62.5 | |
| ReasonCLIPViT=B/32, Resolution=224, Data=+58M2026.06 | 61.5 | |
| GNM-CLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 60 | |
| ReasonCLIPViT=L/14, Resolution=224, Data=+58M2026.06 | 59.5 | |
| ReasonCLIPViT=L/14, Resolution=336, Data=+58M2026.06 | 59.4 | |
| Triplet-CLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 57.4 | |
| CE-CLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 57 | |
| MetaCLIPViT=L/14, Resolution=224, Data=2.5B2026.06 | 54 | |
| Eva-CLIP-02ViT=L/14, Resolution=224, Data=2.0B2026.06 | 52.7 | |
| SigLIP2ViT=L/16, Resolution=384, Data=10.0B2026.06 | 51.7 | |
| SigLIPViT=So/14, Resolution=384, Data=10.0B2026.06 | 51.2 | |
| MetaCLIPViT=B/32, Resolution=224, Data=0.4B2026.06 | 50.6 | |
| SigLIP2ViT=G/16, Resolution=384, Data=10.0B2026.06 | 48.8 | |
| Long-CLIPViT=L/14, Resolution=224, Data=0.4B2026.06 | 48.4 | |
| CLIPViT=B/32, Resolution=224, Data=0.4B2026.06 | 46.7 | |
| CLIPViT=L/14, Resolution=224, Data=0.4B2026.06 | 44.3 | |
| CLIPViT=L/14, Resolution=336, Data=0.4B2026.06 | 44.1 |