General VQA on HRBench
78.5AccuracyGPT 5 + Tools
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT 5 + ToolsModel Category=Tool-Planning Models, Tool Usage=true2026.01 | 78.5 | |
| Gemini 2.5 flashModel Category=Closed-Source Models2026.01 | 78.25 | |
| InternVL3 78BModel Category=Open-Source Models, Backbone=78B2026.01 | 75.12 | |
| GPT 5Model Category=Closed-Source Models2026.01 | 74.38 | |
| Qwen 2.5 VL 72BModel Category=Open-Source Models, Backbone=72B2026.01 | 73 | |
| Qwen 2.5 VL 32BModel Category=Open-Source Models, Backbone=32B2026.01 | 70.12 | |
| AdaReasoner 7BModel Category=Tool-Planning Models, Backbone=7B2026.01 | 69.12 | |
| Qwen 2.5 VL 72B + ToolsModel Category=Tool-Planning Models, Tool Usage=true, Backbone=72B2026.01 | 67.12 | |
| DeepEyesModel Category=Tool-Planning Models, Unified Evaluation Framework=true2026.01 | 67 | |
| Qwen 2.5 VL 7B + ToolsModel Category=Tool-Planning Models, Tool Usage=true, Backbone=7B2026.01 | 63.75 | |
| Qwen 2.5 VL 7BModel Category=Open-Source Models, Backbone=7B2026.01 | 63.62 | |
| Claude 4 sonnetModel Category=Closed-Source Models2026.01 | 60.62 | |
| Qwen 2.5 VL 3BModel Category=Open-Source Models, Backbone=3B2026.01 | 53 | |
| PixelReasonerModel Category=Tool-Planning Models, Unified Evaluation Framework=true2026.01 | 52.12 |