Video Spatial Understanding on MMSI-Bench 500 QA subset
35.3AccuracyCoCoSI
Evaluation Results
| Method | Links | |
|---|---|---|
| CoCoSIBackbone=Qwen2.5-VL-32B, Training-free=true, Agentic Collaboration=true, CogMap=true2026.06 | 35.3 | |
| Single-Agent BaselineBackbone=Qwen2.5-VL-32B, Training-free=true, Agentic Collaboration=false, CogMap=true2026.06 | 32.4 | |
| TraveLERBackbone=Qwen2.5-VL-32B, Training-free=true, Agentic Collaboration=true, CogMap=false2026.06 | 31.9 | |
| VCABackbone=Qwen2.5-VL-32B, Training-free=true, Agentic Collaboration=false, CogMap=false2026.06 | 31.6 | |
| VideoAgentBackbone=Qwen2.5-VL-32B, Training-free=true, Agentic Collaboration=false, CogMap=false2026.06 | 31.2 |