Visual Reasoning on V*Bench
95.7AccuracyChatGPT-o3
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ChatGPT-o3Category=Thinking with Images2026.02 | 95.7 | — | |
| SPARCBase Model=Qwen3-VL-8B, Configuration=w/ SFT2026.02 | 91.2 | — | |
| Qwen3-VLVariant=235B-A22B, Category=Thinking with Images2026.02 | 91.1 | — | |
| DeepEyesCategory=Thinking with Images2026.02 | 90.1 | — | |
| SPARCBase Model=Qwen3-VL-8B, Configuration=w/ Consistency2026.02 | 89.5 | — | |
| SPARCBase Model=Qwen3-VL-8B2026.02 | 88.7 | — | |
| Qwen3-VL-8BMode=Native Performance2026.02 | 87 | — | |
| CISCBackbone=DeepEyes-7B2026.02 | 87 | 55.4 | |
| RTWIBackbone=DeepEyes-7B2026.02 | 87 | 67.5 | |
| ViGoRL-7BCategory=Thinking with Images2026.02 | 86.4 | — | |
| Base*Backbone=DeepEyes-7B2026.02 | 86.1 | — | |
| SCBackbone=DeepEyes-7B2026.02 | 86.1 | — | |
| ESCBackbone=DeepEyes-7B2026.02 | 86.1 | 55 | |
| DeepconfBackbone=DeepEyes-7B2026.02 | 86.1 | 58.2 | |
| ASCBackbone=DeepEyes-7B2026.02 | 85.2 | 60 | |
| Self-Uncer.Backbone=DeepEyes-7B2026.02 | 85.2 | 62.5 | |
| Pixel-ReasonerCategory=Thinking with Images2026.02 | 84.3 | — | |
| Gemini 2.5 ProAccess=Close-source2026.02 | 83.8 | — | |
| Thyme2026.02 | 83.5 | — | |
| SAYO-Qwen-4BBase Model=Qwen3-VL-4B2026.02 | 83.25 | — | |
| Long Grounded Thoughts (Multistage SFT + DPO)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 83.25 | — | |
| SAYO-Qwen-8BBase Model=Qwen3-VL-8B2026.02 | 82.2 | — | |
| MiMo-VL-7B-RLOpen Model=Yes, Open Data=No2025.11 | 81.7 | — | |
| Long Grounded Thoughts (SFT + GRPO)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 81.68 | — | |
| Qwen3-VL-8BParameters=8B2026.02 | 81.15 | — | |
| MiMo-VL-7B-SFTOpen Model=Yes, Open Data=No2025.11 | 80.6 | — | |
| Qwen2.5-VL-7B-Instruct + LongPerceptualThoughtsOpen Model=Yes, Open Data=Yes2025.11 | 80.6 | — | |
| GPT-4oVisual Sketchpad=Enabled2024.06 | 80.3 | — | |
| OpenVLThinker-7BParameters=7B2026.02 | 80.1 | — | |
| Reinforcing VLMsCategory=Thinking with Images2026.02 | 80.1 | — | |
| Long Grounded Thoughts (SFT + DPO)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 80.1 | — | |
| InternVL3.5-38BParameters=38B2026.02 | 79.58 | — | |
| Qwen3-VL-4BParameters=4B2026.02 | 79.06 | — | |
| Long Grounded Thoughts (SFT)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 79.05 | — | |
| Semantic-back-7BParameters=7B2026.02 | 78.01 | — | |
| NoisyRollout-7BParameters=7B2026.02 | 76.96 | — | |
| MGPOBase Model=Qwen2.5-VL-7B2025.07 | 76.4 | — | |
| SOTA [51]2024.06 | 75.4 | — | |
| Kimi-VL-16BParameters=16B2026.02 | 75.39 | — | |
| Qwen2.5-VL-7B-InstructOpen Model=Yes, Open Data=No2025.11 | 75.39 | — | |
| GPT-4oOpen Model=No, Open Data=No2025.11 | 73.9 | — | |
| InternVL3.5-8BParameters=8B2026.02 | 73.82 | — | |
| SAYO-InternVL-8BBase Model=InternVL3.5-8B2026.02 | 72.77 | — | |
| InternVL3.5-30B-A3BParameters=30B-A3B2026.02 | 72.25 | — | |
| GPT-4o2026.02 | 72.2 | — | |
| GRPOBase Model=Qwen2.5-VL-7B2025.07 | 71.2 | — | |
| GPT-4 TurboVisual Sketchpad=Enabled2024.06 | 71 | — | |
| InternVL3.5-14BParameters=14B2026.02 | 70.16 | — | |
| ChatGPT-o1Category=Thinking with Images2026.02 | 69.7 | — | |
| o1Open Model=No, Open Data=No2025.11 | 69.7 | — | |
| Qwen2.5-VL-7B-Instruct + Revisual-R1-finalOpen Model=Yes, Open Data=Yes2025.11 | 68.58 | — | |
| MGPOBase Model=Qwen2.5-VL-3B2025.07 | 67 | — | |
| GRPOBase Model=Qwen2.5-VL-3B2025.07 | 66.5 | — | |
| GPT-4oVisual Sketchpad=Disabled2024.06 | 66 | — | |
| ViGoRL2026.02 | 60.73 | — | |
| R1-Onevision-7BParameters=7B2026.02 | 57.07 | — | |
| Qwen2.5-VL-7B-Instruct + VLAA-ThinkerOpen Model=Yes, Open Data=Yes2025.11 | 56.54 | — | |
| GPT-4V-preview2024.06 | 55 | — | |
| Qwen3-VL-30B-A3BParameters=30B-A3B2026.02 | 52.88 | — | |
| GPT-4 TurboVisual Sketchpad=Disabled2024.06 | 52.5 | — | |
| LLaVA-1.5-7B2024.06 | 48.7 | — | |
| Gemini-Pro2024.06 | 48.2 | — |