Compositional Scene Understanding on Winoground
64Text Alignment ScoreGPT4V
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT4VPrompting Strategy=Compositional Chain-of-Thought (CCoT)2023.11 | 64 | 54.5 | 43.3 | — | |
| GPT4VPrompting Strategy=Zero-Shot CoT2023.11 | 63.3 | 52.5 | 41 | — | |
| GPT4VPrompting Strategy=Base2023.11 | 60.3 | 45.3 | 33.5 | — | |
| SGVLBackbone=BLIP2023.05 | 42.8 | 27.3 | 21.5 | — | |
| SGVLBackbone=BLIP22023.05 | 42.8 | 28.5 | 23.3 | — | |
| SGVLTraining=Supervised and finetuned on annotated scene graphs2023.11 | 42.8 | 28.5 | 23.3 | — | |
| NegBLIP2023.05 | 42.5 | 24 | 18.5 | — | |
| BLIP22023.05 | 42 | 23.8 | 19 | — | |
| BLIP2Prompting Strategy=Base2023.11 | 42 | 23.8 | 19 | — | |
| NegBLIP22023.05 | 41.5 | 26 | 20.5 | — | |
| LLaVA-1.5-13BPrompting Strategy=Compositional Chain-of-Thought (CCoT)2023.11 | 39.8 | 37.3 | 22.3 | — | |
| BLIP2023.05 | 39 | 19.2 | 15 | — | |
| BLIPPrompting Strategy=Base2023.11 | 39 | 19.2 | 15 | — | |
| LLaVA-1.5-13BPrompting Strategy=Zero-Shot CoT2023.11 | 36.8 | 35 | 19.8 | — | |
| SphinxPrompting Strategy=Compositional Chain-of-Thought (CCoT)2023.11 | 36.5 | 36.3 | 22.5 | — | |
| SphinxPrompting Strategy=Zero-Shot CoT2023.11 | 36 | 38.5 | 21.5 | — | |
| ViLT2023.05 | 34.8 | 14 | 9.3 | — | |
| LLaVA-1.5-13BPrompting Strategy=Base2023.11 | 33.5 | 35 | 17.3 | — | |
| Static Margin2026.04 | 32.5 | 9.75 | 8.5 | 54.07 | |
| FLAVA2023.05 | 32.3 | 20 | 14.5 | — | |
| D_wo + InfoNCEData Variant=D_wo, Loss Function=InfoNCE2026.04 | 32.25 | 9.75 | 8 | 52.26 | |
| SGVLBackbone=CLIP2023.05 | 32 | 14 | 9.8 | — | |
| D_hc + InfoNCEData Variant=D_hc, Loss Function=InfoNCE2026.04 | 31.75 | 10.75 | 8.75 | 53.89 | |
| D_lc + InfoNCEData Variant=D_lc, Loss Function=InfoNCE2026.04 | 31.25 | 9.25 | 7.75 | 52.03 | |
| Slipform2026.04 | 31 | 10.25 | 7.75 | 54.18 | |
| Inverse Margin2026.04 | 30.75 | 9.75 | 7 | 52.92 | |
| CLIP2023.05 | 30.7 | 10.5 | 8 | — | |
| CLIPPrompting Strategy=Base2023.11 | 30.7 | 10.5 | 8 | — | |
| NegCLIP2026.04 | 30.5 | 11 | 8 | 53.15 | |
| D_wo + CementData Variant=D_wo, Loss Function=Cement2026.04 | 30.25 | 12 | 8.25 | 53.82 | |
| NegCLIP2023.05 | 29.5 | 10.5 | 8 | — | |
| SphinxPrompting Strategy=Base2023.11 | 29 | 29 | 16.3 | — | |
| CLIP2026.04 | 29 | 9 | 7.5 | 47.89 | |
| D_lc + CementData Variant=D_lc, Loss Function=Cement2026.04 | 29 | 9.75 | 6.25 | 53.72 | |
| InstructBLIP-13BPrompting Strategy=Compositional Chain-of-Thought (CCoT)2023.11 | 26 | 27 | 11.5 | — | |
| TripletCLIP2026.04 | 25.75 | 11 | 7 | 50.92 | |
| LLaVA2023.05 | 24.8 | 25 | 13 | — | |
| DeGLA2026.04 | 24.5 | 10 | 7.25 | 54.01 | |
| TSVLC+2026.04 | 24 | 8 | 4.75 | 45.13 | |
| MiniGPT-42023.05 | 23.3 | 18 | 9.5 | — | |
| TSVLC2026.04 | 21.25 | 8.5 | 4.75 | 47.75 | |
| CE-CLIP2026.04 | 18.5 | 11.25 | 5 | 49.08 | |
| InstructBLIP-13BPrompting Strategy=Zero-Shot CoT2023.11 | 15.8 | 14.8 | 6 | — | |
| InstructBLIP-13BPrompting Strategy=Base2023.11 | 12.8 | 13.3 | 4.5 | — |