Spatial Reasoning on What’sUp
63.7AccuracyDCSM
Evaluation Results
| Method | Links | |
|---|---|---|
| DCSMTraining Source=coco, Base Model=CLIP ViTB/162025.03 | 63.7 | |
| DCSMTraining Source=synth, Base Model=CLIP ViTB/162025.03 | 62.6 | |
| LABCLIPTraining data=Spatial data2025.02 | 54 | |
| NegCLIP2025.03 | 33.2 | |
| CLIPBackbone=ViT B/322025.03 | 31.9 | |
| CLIPTraining data=–2025.02 | 31 | |
| LABCLIPTraining data=COCO2025.02 | 31 | |
| LABCLIPTraining data=CC3M2025.02 | 31 | |
| CLIPBackbone=ViT B/162025.03 | 30.5 | |
| SigLIP2025.03 | 26 | |
| Random Chance2025.03 | 25 | |
| CoCa2025.03 | 24.5 | |
| BLIP2025.03 | 24.4 |