Out-of-view Understanding on OpenView-Bench Overall
0.83Choice AccuracyHuman-level
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Human-level2025.12 | 0.83 | — | — | |
| Gemini-2.5-flashRank=22025.12 | 0.6518 | 0.9457 | 0.6164 | |
| MiniCPM-V 4.5Rank=32025.12 | 0.6307 | 0.8865 | 0.5591 | |
| Qwen3-VL-8B-ThinkingRank=5, Thinking Mode=true2025.12 | 0.63 | 0.823 | 0.5185 | |
| GPT-5Rank=12025.12 | 0.6225 | 0.9927 | 0.6179 | |
| GPT-4oRank=92025.12 | 0.6209 | 0.7415 | 0.4604 | |
| Qwen2.5-VL-72B-InstructRank=62025.12 | 0.6149 | 0.8395 | 0.5162 | |
| Qwen2.5-VL-32B-InstructRank=42025.12 | 0.6043 | 0.8591 | 0.5192 | |
| GPT-4o-miniRank=102025.12 | 0.5735 | 0.7411 | 0.425 | |
| Ovis2.5-9BRank=72025.12 | 0.5674 | 0.8845 | 0.5019 | |
| Qwen2.5-VL-7B-InstructRank=152025.12 | 0.5441 | 0.6136 | 0.3338 | |
| Qwen3-VL-8B-InstructRank=82025.12 | 0.529 | 0.9088 | 0.4808 | |
| Qwen2.5-VL-3B-InstructRank=172025.12 | 0.5237 | 0.0647 | 0.0339 | |
| GLM-4.1V-9B-BaseRank=132025.12 | 0.5222 | 0.6681 | 0.3489 | |
| InternVL3.5-8BRank=142025.12 | 0.5177 | 0.6594 | 0.3414 | |
| InternVL3.5-8BRank=13, Thinking Mode=true2025.12 | 0.5162 | 0.6759 | 0.3489 | |
| GLM-4.1V-9B-ThinkingRank=11, Thinking Mode=true2025.12 | 0.4959 | 0.772 | 0.3828 | |
| LLaVA-NeXT-Mistral-7BRank=162025.12 | 0.3549 | 0.4459 | 0.1582 |