Visual Question Answering on SAT Real
84.1AccuracySandboxVLM
Evaluation Results
| Method | Links | |
|---|---|---|
| SandboxVLMMethod Category=Test-time Scaling VLMs2025.11 | 84.1 | |
| RoboBrain2.0-32BMethod Category=Training-Based Models, Model Scale=32B2025.11 | 80.3 | |
| Robix-32B-BaseMethod Category=Training-Based Models, Model Scale=32B2025.11 | 79.6 | |
| Gemini-2.5-ProMethod Category=Generalist VLMs2025.11 | 79.3 | |
| MindJourneyMethod Category=Test-time Scaling VLMs2025.11 | 78.7 | |
| GPT-5-miniMethod Category=Generalist VLMs2025.11 | 75.4 | |
| Claude-Sonnet-4Method Category=Generalist VLMs2025.11 | 75.3 | |
| Qwen2.5-VL-32BMethod Category=Generalist VLMs, Model Scale=32B2025.11 | 74.9 | |
| Magma-8BMethod Category=Training-Based Models, Model Scale=8B2025.11 | 71.3 | |
| Cosmos-Reason1Method Category=Training-Based Models2025.11 | 60.7 | |
| Qwen2.5-VL-72BMethod Category=Generalist VLMs, Model Scale=72B2025.11 | 58.7 | |
| GPT-4oMethod Category=Generalist VLMs2025.11 | 58.3 | |
| VeBrain-8BMethod Category=Training-Based Models, Model Scale=8B2025.11 | 58 |