Compositional Reasoning on VALSE
89.2Average ScoreBEiTScore
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| BEiTScoreMethod Category=Encoder-based, Backbone=ViT-L/142026.05 | 89.2 | 96.2 | 82.5 | — | 86.7 | 86.7 | 93.9 | — | — | 99.2 | 83.2 | 85.7 | 88.8 | |
| FLEURMethod Category=LLM-based2026.05 | 87.7 | 87.1 | 86.4 | — | 90.5 | 87.7 | 87.7 | — | — | 91.2 | 88 | 85.8 | 85.9 | |
| BEiTScoreMethod Category=Encoder-based, Backbone=ViT-L/14, Training Stage=without Stage 12026.05 | 87.1 | 97 | 75.2 | — | 83.6 | 83 | 90.3 | — | — | 98 | 83.5 | 83 | 90.1 | |
| VQAScoreMethod Category=LLM-based, Backbone=CLIP-FlanT5-XXL2026.05 | 85.6 | 95 | 78.1 | — | 82.2 | 85.3 | 82.3 | — | — | 96.8 | 80 | 83.1 | 87.9 | |
| EXPERTMethod Category=LLM-based2026.05 | 85.2 | 84 | 85.2 | — | 91.8 | 90.1 | 90.1 | — | — | 91.7 | 82.2 | 80.4 | 82.4 | |
| BEiTScoreMethod Category=Encoder-based, Backbone=ViT-B/322026.05 | 82.3 | 94.1 | 75.1 | — | 83 | 81.6 | 90.4 | — | — | 97.5 | 66 | 73.9 | 79.4 | |
| ReasonCLIP + READViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 79.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEiTScoreMethod Category=Encoder-based, Backbone=ViT-B/32, Training Stage=without Stage 12026.05 | 78.5 | 88.7 | 67.3 | — | 71.8 | 72.1 | 85.8 | — | — | 94.7 | 72.7 | 73.4 | 80.1 | |
| ReasonSigLIP2ViT=G/16, Resolution=384, Data=+58M2026.06 | 77.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CE-CLIP+#Params=151M2023.06 | 76.7 | 84.5 | 79.2 | 67.8 | 76.4 | 83.4 | 89.4 | 56.7 | 57.8 | 94.7 | — | — | — | |
| CE-CLIP+Evaluation Protocol=Zero-shot2023.06 | 76.7 | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReasonCLIPViT=L/14, Resolution=336, Data=+58M2026.06 | 76.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReasonSigLIPViT=So/14, Resolution=384, Data=+58M2026.06 | 76.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| READ-CLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 76.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Long-CLIPViT=L/14, Resolution=224, Data=0.4B2026.06 | 76.1 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CE-CLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 76 | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReasonCLIPViT=L/14, Resolution=224, Data=+58M2026.06 | 75.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| 12-in-1†Method Category=Encoder-based2026.05 | 75.7 | 95.6 | 72.4 | — | 67.7 | 65.9 | 58.9 | — | — | 86.9 | 77.3 | 76.7 | 80.2 | |
| PAC-S++Method Category=Encoder-based, Backbone=ViT-L2026.05 | 73.8 | 74.3 | 73.7 | — | 78.1 | 67 | 72 | — | — | 78.3 | 69.2 | 74.7 | 73.8 | |
| NegCLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 73.7 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Eva-CLIP-02ViT=L/14, Resolution=224, Data=2.0B2026.06 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CE-CLIP#Params=151M2023.06 | 72.5 | 78.6 | 77.7 | 64.4 | 74.4 | 81.2 | 88.6 | 54.7 | 54.8 | 93.7 | — | — | — | |
| CE-CLIPEvaluation Protocol=Zero-shot2023.06 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReasonCLIPViT=B/32, Resolution=224, Data=+58M2026.06 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| SigLIPViT=So/14, Resolution=384, Data=10.0B2026.06 | 72 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP-FTEvaluation Protocol=Fine-tuned on COCO2023.06 | 71.8 | — | — | — | — | — | — | — | — | — | — | — | — | |
| NegCLIP#Params=151M2023.06 | 71.6 | 76.8 | 71.7 | 65 | 72.9 | 81.6 | 84.7 | 58.6 | 53.8 | 91.9 | — | — | — | |
| GPT4oMethod Category=LLM-based, Access=API2026.05 | 71.4 | 51.5 | 75.7 | — | 86 | 73.5 | 94.4 | — | — | 84.9 | 63.1 | 55.7 | 55.9 | |
| SigLIP2ViT=G/16, Resolution=384, Data=10.0B2026.06 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| MetaCLIPViT=L/14, Resolution=224, Data=2.5B2026.06 | 71.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CE-XVLM#Params=216M2023.06 | 70.8 | 83.5 | 72.8 | 72.1 | 68.7 | 71.8 | 69.1 | 51 | 46.8 | 93.8 | — | — | — | |
| GNM-CLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 70.7 | — | — | — | — | — | — | — | — | — | — | — | — | |
| SigLIP2ViT=L/16, Resolution=384, Data=10.0B2026.06 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEIT3#Params=1.9B2023.06 | 70.4 | 77.4 | 74.6 | 68.8 | 74 | 86.7 | 65.2 | 50 | 44.2 | 96 | — | — | — | |
| BLIP#Params=583M2023.06 | 70 | 86.3 | 73.2 | 68.1 | 71.5 | 77.2 | 61.1 | 53.8 | 48.2 | 93.8 | — | — | — | |
| PAC-S++Method Category=Encoder-based, Backbone=ViT-B2026.05 | 69.7 | 74.9 | 69.7 | — | 77 | 66.2 | 66.3 | — | — | 73.8 | 69.5 | 68.9 | 70.1 | |
| XVLM-coco#Params=216M2023.06 | 69.5 | 83 | 75.6 | 67.5 | 70.2 | 73.8 | 68.6 | 46.4 | 49.6 | 94.8 | — | — | — | |
| PAC-SMethod Category=Encoder-based, Backbone=ViT-L2026.05 | 69.5 | 72.3 | 69.8 | — | 78.1 | 63.4 | 64.3 | — | — | 77.8 | 69.5 | 68.6 | 66.9 | |
| LongCLIP-SMethod Category=Encoder-based, Backbone=ViT-B2026.05 | 69.1 | 69.1 | 66.6 | — | 63.2 | 82.4 | 73.8 | — | — | 91.9 | 61.7 | 68.8 | 69.1 | |
| PAC-SMethod Category=Encoder-based, Backbone=ViT-B2026.05 | 69.1 | 71.7 | 69.1 | — | 75.7 | 63.6 | 65.1 | — | — | 69.9 | 69.5 | 67.7 | 67.3 | |
| MetaCLIPViT=B/32, Resolution=224, Data=0.4B2026.06 | 69.1 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPViT=L/14, Resolution=224, Data=0.4B2026.06 | 68.8 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPViT=L/14, Resolution=336, Data=0.4B2026.06 | 68.8 | — | — | — | — | — | — | — | — | — | — | — | — | |
| LongCLIP-SMethod Category=Encoder-based, Backbone=ViT-L2026.05 | 68.6 | 42.8 | 72.4 | — | 68.6 | 89 | 72 | — | — | 96.9 | 60.2 | 54.8 | 58.1 | |
| MiniGPT-4#Params=>9B2023.06 | 68.4 | 65.5 | 72.5 | 67.4 | 68.4 | 83.2 | 58.8 | 52.6 | 51 | 95.8 | — | — | — | |
| CLIPViT=B/32, Resolution=224, Data=0.4B2026.06 | 67.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPECSMethod Category=Encoder-based2026.05 | 66.6 | 55.6 | 63.7 | — | 60.9 | 69.8 | 80 | — | — | 89.2 | 79.7 | 52.5 | 47.7 | |
| CLIP-SMethod Category=Encoder-based, Backbone=ViT-L2026.05 | 66 | 73.9 | 66.3 | — | 63.4 | 85.2 | 62.6 | — | — | 92.5 | 58.2 | 62 | 66 | |
| CyCLIP#Params=151M2023.06 | 65.5 | 69.3 | 58.3 | 61 | 66.4 | 78.1 | 72 | 53.2 | 51.6 | 88.8 | — | — | — | |
| BLIP2#Params=3.4B2023.06 | 65.4 | 55.5 | 71.5 | 66 | 62.4 | 83.6 | 51.6 | 48.6 | 51.9 | 95.9 | — | — | — | |
| CLIP#Params=151M2023.06 | 65.3 | 68.7 | 57.1 | 61 | 65.4 | 77.8 | 71.8 | 54.1 | 51 | 89.8 | — | — | — | |
| CLIPEvaluation Protocol=Zero-shot2023.06 | 65.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP-SMethod Category=Encoder-based, Backbone=ViT-B2026.05 | 64.2 | 74.6 | 63.1 | — | 60.6 | 82.3 | 59.8 | — | — | 89 | 56.4 | 64.2 | 66.4 | |
| Triplet-CLIPViT=B/32, Resolution=224, Fine-tuned on MS-COCO=true2026.06 | 64.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| NegCLIPPre-training Dataset=CC12M2024.11 | 58.59 | — | — | — | — | — | — | — | — | — | — | — | — | |
| NegCLIP++Pre-training Dataset=CC12M2024.11 | 58.12 | — | — | — | — | — | — | — | — | — | — | — | — | |
| TripletCLIPPre-training Dataset=CC12M2024.11 | 57.57 | — | — | — | — | — | — | — | — | — | — | — | — | |
| LaCLIPPre-training Dataset=CC12M2024.11 | 55.69 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Random Chance#Params=N/A2023.06 | 50 | 50 | 50 | 50 | 50 | 50 | 50 | 50 | 50 | 50 | — | — | — | |
| TripletCLIP++Pre-training Dataset=CC3M2024.11 | 48.53 | — | — | — | — | — | — | — | — | — | — | — | — | |
| TripletCLIPPre-training Dataset=CC3M2024.11 | 48.36 | — | — | — | — | — | — | — | — | — | — | — | — | |
| NegCLIPPre-training Dataset=CC3M2024.11 | 48.06 | — | — | — | — | — | — | — | — | — | — | — | — | |
| LaCLIP + HNPre-training Dataset=CC3M2024.11 | 47.91 | — | — | — | — | — | — | — | — | — | — | — | — | |
| NegCLIP++Pre-training Dataset=CC3M2024.11 | 43.65 | — | — | — | — | — | — | — | — | — | — | — | — | |
| LaCLIPPre-training Dataset=CC3M2024.11 | 43.19 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIPBackbone=CLIP ViT-B/162026.06 | — | — | — | — | 68.8 | — | — | — | — | — | — | — | — | |
| CLIPBackbone=CLIP ViT-L/142026.06 | — | — | — | — | 66.7 | — | — | — | — | — | — | — | — | |
| CLIP-FTBackbone=CLIP ViT-B/162026.06 | — | — | — | — | 67.7 | — | — | — | — | — | — | — | — | |
| CLIP-FTBackbone=CLIP ViT-L/142026.06 | — | — | — | — | 71.4 | — | — | — | — | — | — | — | — | |
| MACCO-CLIPBackbone=CLIP ViT-B/162026.06 | — | — | — | — | 70.4 | — | — | — | — | — | — | — | — | |
| MACCO-CLIPBackbone=CLIP ViT-L/142026.06 | — | — | — | — | 74 | — | — | — | — | — | — | — | — | |
| MACCO-SigLIPBackbone=SigLIP ViT-B/162026.06 | — | — | — | — | 71.2 | — | — | — | — | — | — | — | — | |
| Random Chance2026.06 | — | — | — | — | 50 | — | — | — | — | — | — | — | — | |
| SigLIPBackbone=SigLIP ViT-B/162026.06 | — | — | — | — | 53.5 | — | — | — | — | — | — | — | — | |
| SigLIP-FTBackbone=SigLIP ViT-B/162026.06 | — | — | — | — | 67.4 | — | — | — | — | — | — | — | — |