Visual Question Answering on PhysBench
58.3AccuracySandboxVLM
Evaluation Results
| Method | Links | |
|---|---|---|
| SandboxVLMMethod Category=Test-time Scaling VLMs2025.11 | 58.3 | |
| MindJourneyMethod Category=Test-time Scaling VLMs2025.11 | 54.9 | |
| GPT-4oMethod Category=Generalist VLMs2025.11 | 50.3 | |
| GPT-5-miniMethod Category=Generalist VLMs2025.11 | 47.1 | |
| Qwen2.5-VL-72BMethod Category=Generalist VLMs, Model Scale=72B2025.11 | 46.6 | |
| Qwen2.5-VL-32BMethod Category=Generalist VLMs, Model Scale=32B2025.11 | 43.1 |