Multimodal Reasoning on LVista
73.8AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-ProModel Category=Closed-source models2026.06 | 73.8 | |
| GPT-5Model Category=Closed-source models2026.06 | 69.3 | |
| TACO (Ours-7B)Model Category=Code-tool / visual-agent models2026.06 | 55.6 | |
| Qwen3-VL-8BModel Category=Open-source MLLMs (no visual tool), Instruct variant=true2026.06 | 54.9 | |
| Qwen2.5-VL-32BModel Category=Open-source MLLMs (no visual tool), Instruct variant=true2026.06 | 54.4 | |
| GPT-4oModel Category=Closed-source models2026.06 | 53.2 | |
| PyVision-RL-7BModel Category=Code-tool / visual-agent models2026.06 | 49.2 | |
| Thyme-7BModel Category=Code-tool / visual-agent models2026.06 | 49 | |
| DeepEyes-v2-7BModel Category=Code-tool / visual-agent models2026.06 | 48.7 | |
| CodeV-RL-7BModel Category=Code-tool / visual-agent models2026.06 | 48.7 | |
| DeepEyes-7BModel Category=Code-tool / visual-agent models2026.06 | 47.7 | |
| Pixel-Reasoner-7BModel Category=Code-tool / visual-agent models2026.06 | 46.4 | |
| Mini-o3-7BModel Category=Code-tool / visual-agent models2026.06 | 45.7 | |
| InternVL3-8BModel Category=Open-source MLLMs (no visual tool)2026.06 | 45.6 | |
| MathCoder-VL-8BModel Category=Code-tool / visual-agent models2026.06 | 41.6 | |
| Qwen2.5-VL-7BModel Category=Open-source MLLMs (no visual tool), Instruct variant=true2026.06 | 39.8 | |
| LLaVA-OneVision-7BModel Category=Open-source MLLMs (no visual tool)2026.06 | 33.3 |