Spatial Understanding on TopViewRS
0.456AccuracyQwen2.5-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL2026.01 | 0.456 | |
| SmolVLM22026.01 | 0.416 | |
| LLaVA-OneVision2026.01 | 0.414 | |
| LLaVA-NeXT2026.01 | 0.409 | |
| LLaVA v1.52026.01 | 0.384 | |
| LLaVA-SigLIP2encoder=SigLIP22026.01 | 0.371 | |
| LLaVA-SigLIPencoder=SigLIP2026.01 | 0.349 | |
| LLaVA-AIMv2encoder=AIMv22026.01 | 0.339 | |
| LLaVA-AIMv2-2D-RoPEencoder=AIMv2, positional_embedding=2D-RoPE2026.01 | 0.338 | |
| Gemma3-4b-it2026.01 | 0.334 | |
| LLaVA-SigLIP2-2D-RoPEencoder=SigLIP2, positional_embedding=2D-RoPE2026.01 | 0.33 | |
| Molmo2026.01 | 0.323 | |
| PaliGemma2026.01 | 0.322 | |
| LLaVA-SigLIP-2D-RoPEencoder=SigLIP, positional_embedding=2D-RoPE2026.01 | 0.295 | |
| LLaVA-2D-RoPEpositional_embedding=2D-RoPE2026.01 | 0.283 |