Compositional Reasoning on ARO
83.6Relation ScoreCE-CLIP+
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| CE-CLIP+#Params=151M2023.06 | 83.6 | — | — | — | — | — | — | — | — | — | 77.1 | |
| CE-CLIP#Params=151M2023.06 | 83 | — | — | — | — | — | — | — | — | — | 76.4 | |
| DAC-LLM#Params=151M2023.06 | 81.3 | — | — | — | — | — | — | — | — | — | 73.9 | |
| CLIP-SVLC#Params=151M2023.06 | 80.61 | — | — | — | — | — | — | — | — | — | 73.03 | |
| NegCLIP#Params=151M2023.06 | 80.2 | — | — | — | — | — | — | — | — | — | 70.5 | |
| DAC-SAM#Params=151M2023.06 | 77.2 | — | — | — | — | — | — | — | — | — | 70.5 | |
| CE-XVLM#Params=216M2023.06 | 73.9 | — | — | — | — | — | — | — | — | — | 89.3 | |
| XVLM-coco#Params=216M2023.06 | 73.4 | — | — | — | — | — | — | — | — | — | 86.8 | |
| syn-CLIP#Params=151M2023.06 | 71.4 | — | — | — | — | — | — | — | — | — | 66.9 | |
| BEIT3#Params=1.9B2023.06 | 60.6 | — | — | — | — | — | — | — | — | — | 74.6 | |
| CLIP#Params=151M2023.06 | 59.3 | — | — | — | — | — | — | — | — | — | 62.9 | |
| CyCLIP#Params=151M2023.06 | 59.1 | — | — | — | — | — | — | — | — | — | 65.4 | |
| BLIP#Params=583M2023.06 | 59 | — | — | — | — | — | — | — | — | — | 88 | |
| SDS-CLIP#Params=151M2023.06 | 53 | — | — | — | — | — | — | — | — | — | 62 | |
| Random Chance#Params=N/A2023.06 | 50 | — | — | — | — | — | — | — | — | — | 50 | |
| MiniGPT-4#Params=>9B2023.06 | 46.9 | — | — | — | — | — | — | — | — | — | 55.7 | |
| BLIP2#Params=3.4B2023.06 | 41.2 | — | — | — | — | — | — | — | — | — | 71.3 | |
| BLIP+protocol=second-stage binary classification2024.12 | — | — | — | — | — | — | 59 | 88 | — | — | — | |
| BLIP2Architecture=Encoder-decoder2023.05 | — | 41.16 | 71.25 | 13.57 | 13.72 | 53.27 | — | — | — | — | — | |
| Cambrian-8BModel=Cambrian-8B2026.06 | — | — | — | — | — | 84.9 | — | — | — | — | — | |
| CE-CLIP2025.09 | — | 81.2 | 75.6 | 71.9 | 75.6 | — | — | — | — | — | — | |
| CLIPArchitecture=Dual-encoder2023.05 | — | 59.98 | 63.18 | 47.9 | 60.2 | 63.35 | — | — | — | — | — | |
| CLIPTraining Dataset=OpenAI-400M, Image Encoder=ViT-B/16, Text Encoder=Base2023.11 | — | — | — | — | — | — | 58.7 | 62.2 | 50.4 | 57.3 | — | |
| CLIPTraining Dataset=LAION-2B, Image Encoder=ViT-B/16, Text Encoder=Base2023.11 | — | — | — | — | — | — | 39.7 | 62.3 | 31 | 37.5 | — | |
| CLIPTraining Dataset=DataComp-1B, Image Encoder=ViT-B/16, Text Encoder=Base2023.11 | — | — | — | — | — | — | 35.9 | 57 | 29.6 | 35.2 | — | |
| CLIPTraining Dataset=DFN-2B, Image Encoder=ViT-B/16, Text Encoder=Base2023.11 | — | — | — | — | — | — | 33.1 | 57.4 | 18.5 | 22.5 | — | |
| CLIP2024.12 | — | — | — | — | — | — | 59 | 63 | — | — | — | |
| CLIP2025.09 | — | 59.8 | 63 | 47.3 | 58.5 | — | — | — | — | — | — | |
| CoCa2024.12 | — | — | — | — | — | — | 48 | 50 | — | — | — | |
| DAC-LLMArchitecture=Dual-encoder, Caption Density Source=LLM-based2023.05 | — | 81.28 | 73.91 | 94.47 | 95.68 | 85.18 | — | — | — | — | — | |
| DAC-SAMArchitecture=Dual-encoder, Caption Density Source=SAM-based2023.05 | — | 77.16 | 70.5 | 91.22 | 93.88 | 83.83 | — | — | — | — | — | |
| DACLLM2025.09 | — | 81.3 | 73.9 | 94.5 | 95.7 | — | — | — | — | — | — | |
| DCIP12025.09 | — | 72.6 | 67.6 | 88.6 | 91.3 | — | — | — | — | — | — | |
| DreamLIP2025.09 | — | 51.2 | 79 | 52 | 49.8 | — | — | — | — | — | — | |
| Gemini-textinput_modality=text only2024.12 | — | — | — | — | — | — | 71 | 82 | — | — | — | |
| InternVL2-8BModel=InternVL2-8B2026.06 | — | — | — | — | — | 88.7 | — | — | — | — | — | |
| Llama-90BModel=Llama-90B2026.06 | — | — | — | — | — | 85.44 | — | — | — | — | — | |
| LLaVA-13BModel=LLaVA-13B2026.06 | — | — | — | — | — | 83.8 | — | — | — | — | — | |
| LLaVA-7BModel=LLaVA-7B2026.06 | — | — | — | — | — | 74.3 | — | — | — | — | — | |
| LongCLIP2025.09 | — | 59.7 | 63.4 | 56.9 | 69 | — | — | — | — | — | — | |
| LSS2025.09 | — | 62 | 65.7 | 37.7 | 46 | — | — | — | — | — | — | |
| MobileCLIP-BTraining Dataset=DataCompDR-1B, Image Encoder=ViT-B/16, Text Encoder=Base2023.11 | — | — | — | — | — | — | 54.6 | 68.4 | 55.5 | 61.2 | — | |
| NegClipArchitecture=Dual-encoder2023.05 | — | 81 | 71 | 86 | 91 | 78.01 | — | — | — | — | — | |
| NegCLIPaugmentation=hard negatives2024.12 | — | — | — | — | — | — | 71 | 81 | — | — | — | |
| NegCLIP2025.09 | — | 81.8 | 72.1 | 82.5 | 86.7 | — | — | — | — | — | — | |
| OneVision-4BModel=OneVision-4B2026.06 | — | — | — | — | — | 90 | — | — | — | — | — | |
| OneVision-4B-LNModel=OneVision-4B-LN2026.06 | — | — | — | — | — | 87.5 | — | — | — | — | — | |
| OneVision-8BModel=OneVision-8B2026.06 | — | — | — | — | — | 89.9 | — | — | — | — | — | |
| Ourstraining_objective=single contrastive objective, data_augmentation=64M synthetic hard negatives2024.12 | — | — | — | — | — | — | 92 | 94 | — | — | — | |
| SigLIPTraining Dataset=Webli-1B, Image Encoder=ViT-B/16, Text Encoder=Base2023.11 | — | — | — | — | — | — | 35.1 | 56 | 32.7 | 40.7 | — | |
| SigLIP2025.09 | — | 34.8 | 55.9 | 32.7 | 40.7 | — | — | — | — | — | — | |
| SVLCArchitecture=Dual-encoder2023.05 | — | 80.61 | 73.03 | 84.73 | 91.7 | 79.42 | — | — | — | — | — | |
| Verainput_modality=text only2024.12 | — | — | — | — | — | — | 62 | 83 | — | — | — | |
| X-VLM+protocol=second-stage binary classification2024.12 | — | — | — | — | — | — | 73 | 87 | — | — | — |