Vision-Language Compositional Reasoning on SugarCrepe++
66.24AccuracySlipform
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Slipform2026.04 | 66.24 | 54.18 | |
| SPARCLTraining Source=COCO, Num Synthetic Images=820K, Num Synthetic Captions=820K2025.03 | 66.1 | — | |
| Static Margin2026.04 | 65.81 | 54.07 | |
| D_lc + CementData Variant=D_lc, Loss Function=Cement2026.04 | 65.62 | 53.72 | |
| D_hc + InfoNCEData Variant=D_hc, Loss Function=InfoNCE2026.04 | 65.09 | 53.89 | |
| D_wo + CementData Variant=D_wo, Loss Function=Cement2026.04 | 64.93 | 53.82 | |
| NegCLIPTraining Source=COCO, Num Synthetic Captions=500K2025.03 | 64.9 | — | |
| Inverse Margin2026.04 | 64.41 | 52.92 | |
| D_wo + InfoNCEData Variant=D_wo, Loss Function=InfoNCE2026.04 | 63.42 | 52.26 | |
| D_lc + InfoNCEData Variant=D_lc, Loss Function=InfoNCE2026.04 | 63.38 | 52.03 | |
| DeGLA2026.04 | 62.84 | 54.01 | |
| NegCLIP2026.04 | 62.75 | 53.15 | |
| CLIPTraining Source=COCO, Training Protocol=Finetune2025.03 | 62.3 | — | |
| CLIPTraining Protocol=Zero-Shot2025.03 | 59.8 | — | |
| CLIP2026.04 | 59.41 | 47.89 | |
| TripletCLIP2026.04 | 58.43 | 50.92 | |
| [18]Training Source=CC3M, Num Synthetic Captions=9M2025.03 | 55.3 | — | |
| TSVLC2026.04 | 55.3 | 47.75 | |
| TSVLC+2026.04 | 52.49 | 45.13 | |
| CE-CLIP2026.04 | 47.66 | 49.08 |