General Multimodal Understanding on MM*
73.6AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-ProModel Category=Closed-source models2026.06 | 73.6 | |
| GPT-5Model Category=Closed-source models2026.06 | 73 | |
| Qwen3-VL-8BModel Category=Open-source MLLMs (no visual tool), Instruct variant=true2026.06 | 70.9 | |
| TACO (Ours-7B)Model Category=Code-tool / visual-agent models2026.06 | 69.3 | |
| Qwen2.5-VL-32BModel Category=Open-source MLLMs (no visual tool), Instruct variant=true2026.06 | 69.1 | |
| InternVL3-8BModel Category=Open-source MLLMs (no visual tool)2026.06 | 68.5 | |
| CodeV-RL-7BModel Category=Code-tool / visual-agent models2026.06 | 67.6 | |
| DeepEyes-v2-7BModel Category=Code-tool / visual-agent models2026.06 | 66.1 | |
| Thyme-7BModel Category=Code-tool / visual-agent models2026.06 | 65.9 | |
| GPT-4oModel Category=Closed-source models2026.06 | 65.7 | |
| PyVision-RL-7BModel Category=Code-tool / visual-agent models2026.06 | 65.6 | |
| DeepEyes-7BModel Category=Code-tool / visual-agent models2026.06 | 65.3 | |
| Qwen2.5-VL-7BModel Category=Open-source MLLMs (no visual tool), Instruct variant=true2026.06 | 64.7 | |
| Pixel-Reasoner-7BModel Category=Code-tool / visual-agent models2026.06 | 64.7 | |
| Mini-o3-7BModel Category=Code-tool / visual-agent models2026.06 | 63.8 | |
| MathCoder-VL-8BModel Category=Code-tool / visual-agent models2026.06 | 62.5 | |
| LLaVA-OneVision-7BModel Category=Open-source MLLMs (no visual tool)2026.06 | 61.7 |