Multimodal Perception on MME-RW
68.6AccuracyGPT-5
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5Model Category=Closed-source models2026.06 | 68.6 | |
| TACO (Ours-7B)Model Category=Code-tool / visual-agent models2026.06 | 66.2 | |
| Mini-o3-7BModel Category=Code-tool / visual-agent models2026.06 | 65.5 | |
| DeepEyes-v2-7BModel Category=Code-tool / visual-agent models2026.06 | 64.9 | |
| Thyme-7BModel Category=Code-tool / visual-agent models2026.06 | 64.8 | |
| CodeV-RL-7BModel Category=Code-tool / visual-agent models2026.06 | 64.5 | |
| Pixel-Reasoner-7BModel Category=Code-tool / visual-agent models2026.06 | 64.4 | |
| DeepEyes-7BModel Category=Code-tool / visual-agent models2026.06 | 64.1 | |
| GPT-4oModel Category=Closed-source models2026.06 | 62.8 | |
| InternVL3-8BModel Category=Open-source MLLMs (no visual tool)2026.06 | 61.3 | |
| Qwen2.5-VL-32BModel Category=Open-source MLLMs (no visual tool), Instruct variant=true2026.06 | 61 | |
| Qwen3-VL-8BModel Category=Open-source MLLMs (no visual tool), Instruct variant=true2026.06 | 60.3 | |
| PyVision-RL-7BModel Category=Code-tool / visual-agent models2026.06 | 59.6 | |
| Gemini-2.5-ProModel Category=Closed-source models2026.06 | 58.3 | |
| Qwen2.5-VL-7BModel Category=Open-source MLLMs (no visual tool), Instruct variant=true2026.06 | 58.3 | |
| LLaVA-OneVision-7BModel Category=Open-source MLLMs (no visual tool)2026.06 | 57.4 | |
| MathCoder-VL-8BModel Category=Code-tool / visual-agent models2026.06 | 52.9 |