Visual Reasoning on V*
96.03AccuracyDynamo (Full)
Evaluation Results
| Method | Links | |
|---|---|---|
| Dynamo (Full)Model=Qwen3.5-27B, Evolution Strategy=Full2026.06 | 96.03 | |
| Dynamo (Full)Model=Doubao-Seed-2.0, Evolution Strategy=Full2026.06 | 95.58 | |
| Dynamo (Tool Only)Model=Qwen3.5-27B, Evolution Strategy=Tool Only2026.06 | 95.14 | |
| Dynamo (Tool Only)Model=Doubao-Seed-2.0, Evolution Strategy=Tool Only2026.06 | 94.48 | |
| S1-VL-32B-RLCategory=Thinking-with-Images Specialist Models, Parameters=32B, Training Stage=RL2026.04 | 92.7 | |
| Penguin-VLModel Size=8B2026.03 | 90.2 | |
| Qwen3-VLModel Size=8B2026.03 | 90.1 | |
| S1-VL-32B-SFTCategory=Thinking-with-Images Specialist Models, Parameters=32B, Training Stage=SFT2026.04 | 90 | |
| Base AgentModel=Qwen3.5-27B, Evolution Strategy=None2026.06 | 88.08 | |
| Skywork-R1V4-30BCategory=Thinking-with-Images Specialist Models, Parameters=30B2026.04 | 88 | |
| Dynamo (Full)Model=o4-mini, Evolution Strategy=Full2026.06 | 86.98 | |
| Qwen3-VL-32B-ThinkingCategory=Open-Source Models, Parameters=32B2026.04 | 86.91 | |
| Base AgentModel=Doubao-Seed-2.0, Evolution Strategy=None2026.06 | 86.75 | |
| Dynamo (Skill Only)Model=Qwen3.5-27B, Evolution Strategy=Skill Only2026.06 | 86.75 | |
| Dynamo (Skill Only)Model=Doubao-Seed-2.0, Evolution Strategy=Skill Only2026.06 | 86.09 | |
| Dynamo (Full)Model=GPT-5.4, Evolution Strategy=Full2026.06 | 85.21 | |
| Dynamo (Tool Only)Model=GPT-5.4, Evolution Strategy=Tool Only2026.06 | 84.77 | |
| Dynamo (Tool Only)Model=o4-mini, Evolution Strategy=Tool Only2026.06 | 83.87 | |
| Thyme-VL (7B)Category=Thinking-with-Images Specialist Models, Parameters=7B2026.04 | 82.2 | |
| Qwen2.5-VL-32BCategory=Open-Source Models, Parameters=32B2026.04 | 81.2 | |
| InternVL3 78BModel Category=Open-Source Models, Backbone=78B2026.01 | 81.15 | |
| Qwen3-VL-235B-A22B-ThinkingCategory=Open-Source Models, Parameters=235B-A22B2026.04 | 80.6 | |
| Qwen 2.5 VL 72BModel Category=Open-Source Models, Backbone=72B2026.01 | 80.1 | |
| Gemini 2.5 ProCategory=Proprietary Models2026.04 | 79.1 | |
| Gemini-2.5-ProModel Type=Closed-source2026.05 | 79.1 | |
| ATLASGRPOTraining=GRPO2026.05 | 77.9 | |
| MonetModel Type=Latent Visual2026.05 | 77.8 | |
| LVRModel Type=Latent Visual2026.05 | 77.5 | |
| ATLASSFTTraining=SFT2026.05 | 77.5 | |
| Base AgentModel=GPT-5.4, Evolution Strategy=None2026.06 | 77.48 | |
| Dynamo (Skill Only)Model=GPT-5.4, Evolution Strategy=Skill Only2026.06 | 76.82 | |
| Qwen2.5-VL-7BCategory=Open-Source Models, Parameters=7B2026.04 | 76.4 | |
| MCOTModel Type=Latent Visual2026.05 | 76.4 | |
| Dynamo (Skill Only)Model=o4-mini, Evolution Strategy=Skill Only2026.06 | 76.16 | |
| LLaVA-OneVision-7BModel Type=Standard2026.05 | 75.4 | |
| ATLASLA-GRPOTraining=LA-GRPO2026.05 | 75.4 | |
| VTS-VModel Type=Agentic Visual2026.05 | 74.9 | |
| GPT 5Model Category=Closed-Source Models2026.01 | 74.87 | |
| GPT-5Category=Proprietary Models2026.04 | 74.87 | |
| Intern-S1 (235B+6B)Category=Open-Source Models, Parameters=235B+6B2026.04 | 74.86 | |
| Gemini-2.0-FlashModel Type=Closed-source2026.05 | 73.3 | |
| Base AgentModel=o4-mini, Evolution Strategy=None2026.06 | 72.85 | |
| CoVTModel Type=Latent Visual2026.05 | 72.8 | |
| Gemini 2.5 FlashCategory=Proprietary Models2026.04 | 72.3 | |
| Qwen 2.5 VL 32BModel Category=Open-Source Models, Backbone=32B2026.01 | 72.25 | |
| InternVL-3.5Model Size=8B2026.03 | 70.7 | |
| AdaReasoner 7BModel Category=Tool-Planning Models, Backbone=7B2026.01 | 70.68 | |
| InternVL3-8BCategory=Open-Source Models, Parameters=8B2026.04 | 70.2 | |
| Qwen2.5-VLModel Type=Standard2026.05 | 70.2 | |
| GPT 5 + ToolsModel Category=Tool-Planning Models, Tool Usage=true2026.01 | 70.16 | |
| Gemini 2.5 flashModel Category=Closed-Source Models2026.01 | 68.59 | |
| DeepEyesModel Category=Tool-Planning Models, Unified Evaluation Framework=true2026.01 | 67.54 | |
| Dynamo (Full)Model=GPT-4o, Evolution Strategy=Full2026.06 | 66.89 | |
| Qwen 2.5 VL 72B + ToolsModel Category=Tool-Planning Models, Tool Usage=true, Backbone=72B2026.01 | 65.97 | |
| Dynamo (Skill Only)Model=GPT-4o, Evolution Strategy=Skill Only2026.06 | 64.24 | |
| OpenAI GPT-5 nanoModel Size=nano2026.03 | 63.4 | |
| Qwen 2.5 VL 7BModel Category=Open-Source Models, Backbone=7B2026.01 | 63.35 | |
| GPT-4oModel Type=Closed-source2026.05 | 62.8 | |
| Gemma-3-27BModel Type=Standard2026.05 | 62.3 | |
| Dynamo (Tool Only)Model=GPT-4o, Evolution Strategy=Tool Only2026.06 | 62.25 | |
| Claude 4 sonnetModel Category=Closed-Source Models2026.01 | 59.69 | |
| Intern-S1-mini (8B)Category=Open-Source Models, Parameters=8B2026.04 | 58.64 | |
| Base AgentModel=GPT-4o, Evolution Strategy=None2026.06 | 58.28 | |
| BagelModel Type=Unified2026.05 | 55.5 | |
| Qwen 2.5 VL 7B + ToolsModel Category=Tool-Planning Models, Tool Usage=true, Backbone=7B2026.01 | 54.97 | |
| PixelReasonerModel Category=Tool-Planning Models, Unified Evaluation Framework=true2026.01 | 53.4 | |
| Visual CoTModel Type=Agentic Visual2026.05 | 44.5 | |
| Qwen 2.5 VL 3BModel Category=Open-Source Models, Backbone=3B2026.01 | 43.98 | |
| V-ThinkerModel Type=Agentic Visual2026.05 | 41.4 | |
| MiniGPT-v2Model Type=Standard2026.05 | 35.6 | |
| AnoleModel Type=Unified2026.05 | 25.4 | |
| Claude-4-SonnetModel Type=Closed-source2026.05 | 15.2 |