Multimodal Reasoning on MVerse
76.9AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-ProModel Category=Closed-source models2026.06 | 76.9 | |
| GPT-5Model Category=Closed-source models2026.06 | 66.7 | |
| Qwen3-VL-8BModel Category=Open-source MLLMs (no visual tool), Instruct variant=true2026.06 | 62.1 | |
| TACO (Ours-7B)Model Category=Code-tool / visual-agent models2026.06 | 57.2 | |
| PyVision-RL-7BModel Category=Code-tool / visual-agent models2026.06 | 55.8 | |
| DeepEyes-v2-7BModel Category=Code-tool / visual-agent models2026.06 | 52.7 | |
| CodeV-RL-7BModel Category=Code-tool / visual-agent models2026.06 | 49.2 | |
| DeepEyes-7BModel Category=Code-tool / visual-agent models2026.06 | 47.3 | |
| Pixel-Reasoner-7BModel Category=Code-tool / visual-agent models2026.06 | 46.9 | |
| MathCoder-VL-8BModel Category=Code-tool / visual-agent models2026.06 | 46.5 | |
| Mini-o3-7BModel Category=Code-tool / visual-agent models2026.06 | 45.4 | |
| Qwen2.5-VL-32BModel Category=Open-source MLLMs (no visual tool), Instruct variant=true2026.06 | 40 | |
| Thyme-7BModel Category=Code-tool / visual-agent models2026.06 | 39.1 | |
| GPT-4oModel Category=Closed-source models2026.06 | 35.3 | |
| Qwen2.5-VL-7BModel Category=Open-source MLLMs (no visual tool), Instruct variant=true2026.06 | 35.2 | |
| InternVL3-8BModel Category=Open-source MLLMs (no visual tool)2026.06 | 29.2 | |
| LLaVA-OneVision-7BModel Category=Open-source MLLMs (no visual tool)2026.06 | 19.3 |