Video Spatial Understanding on MMSI-Bench 500 QA pairs
41AccuracyCoCoSI
Evaluation Results
| Method | Links | |
|---|---|---|
| CoCoSIBackbone=Gemini-2.5-Flash, Training-free=true, Agentic Collaboration=true, CogMap=true2026.06 | 41 | |
| Single-Agent BaselineBackbone=Gemini-2.5-Flash, Training-free=true, Agentic Collaboration=false, CogMap=true2026.06 | 36.6 | |
| TraveLERBackbone=Gemini-2.5-Flash, Training-free=true, Agentic Collaboration=true, CogMap=false2026.06 | 36 | |
| VCABackbone=Gemini-2.5-Flash, Training-free=true, Agentic Collaboration=false, CogMap=false2026.06 | 35.8 | |
| VideoAgentBackbone=Gemini-2.5-Flash, Training-free=true, Agentic Collaboration=false, CogMap=false2026.06 | 35.4 |