Vision-Language Reasoning on ScanQA ScanNet scenes (test)
43.3BLEU-1DINOv3 + SpatialBoost
Evaluation Results
| Method | Links | |
|---|---|---|
| DINOv3 + SpatialBoostBase Model=DINOv3, Evaluation=Unified probing, SpatialBoost=true2026.03 | 43.3 | |
| SigLIPv2 + SpatialBoostBase Model=SigLIPv2, Evaluation=Unified probing, SpatialBoost=true2026.03 | 40.8 | |
| DINOv3Evaluation=Unified probing2026.03 | 40.6 | |
| PE-CoreEncoder Type=Vision-Language trained encoder, Evaluation=Unified probing2026.03 | 40.5 | |
| DINOv2 + SpatialBoostBase Model=DINOv2, Evaluation=Unified probing, SpatialBoost=true2026.03 | 40.3 | |
| dino.txtEncoder Type=Vision-Language trained encoder, Evaluation=Unified probing2026.03 | 39.8 | |
| DINOv2Evaluation=Unified probing2026.03 | 39.5 | |
| OpenCLIP + SpatialBoostBase Model=OpenCLIP, Evaluation=Unified probing, SpatialBoost=true2026.03 | 39.2 | |
| SigLIPv2Evaluation=Unified probing2026.03 | 38.1 | |
| V-JEPAv2Encoder Type=Vision-only trained encoder, Evaluation=Unified probing2026.03 | 37.7 | |
| AIMv2Encoder Type=Vision-Language trained encoder, Evaluation=Unified probing2026.03 | 37.4 | |
| TIPSEncoder Type=Vision-Language trained encoder, Evaluation=Unified probing2026.03 | 37.4 | |
| OpenCLIPEvaluation=Unified probing2026.03 | 36.9 |