Visual Reasoning on MMStar
69AccuracyGazeVLM (Ours)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GazeVLM (Ours)Gaze Bias=Enabled, Base Model=Qwen3-VL-4B2026.05 | 69 | — | — | |
| Insight-V++Size=7B, Base Model=Qwen2.5-VL, Self-Evolving=true2026.03 | 68.2 | — | — | |
| Qwen3-VL-4BTraining Paradigm=Vanilla Open-source, Parameters=4B2026.05 | 67.3 | — | — | |
| GazeVLM (w/o gaze bias)Gaze Bias=None, Base Model=Qwen3-VL-4B2026.05 | 67.1 | — | — | |
| Qwen2.5-VL + Multi-Agent (RL)Size=7B, Multi-Agent (RL)=true2026.03 | 66.4 | — | — | |
| DualMindVLMSize=7B, Strategy=RL2025.11 | 65.3 | 121 | — | |
| Supervised ETTCEnsemble Composition=Same Family Models2026.05 | 65.07 | — | 1.34 | |
| ThinkLiteSize=7B, Strategy=RL2025.11 | 65 | 175 | — | |
| VL-RethinkerSize=7B, Strategy=RL2025.11 | 64.9 | 231 | — | |
| MM-EurekaSize=7B, Strategy=RL2025.11 | 64.1 | 246 | — | |
| Qwen2.5-VLSize=7B, Strategy=-2025.11 | 63.9 | 155 | — | |
| Qwen2.5-VLSize=7B2026.03 | 63.9 | — | — | |
| ETTCEnsemble Composition=Same Family Models2026.05 | 63.73 | — | — | |
| OpenVLThinkerSize=7B, Strategy=SFT+RL2025.11 | 63.3 | 200 | — | |
| Insight-VSize=7B, Base Model=Our Base Model, Iterative DPO=true2026.03 | 61.5 | — | — | |
| Vision-R1-LlamaV-CI-11BTraining Paradigm=SFT-based, Parameters=11B2026.05 | 61.4 | — | — | |
| VotingEnsemble Composition=Same Family Models2026.05 | 61 | — | — | |
| POINTSSize=7B2026.03 | 60.9 | — | — | |
| Qwen2-VLSize=7B2026.03 | 60.7 | — | — | |
| Supervised ETTCEnsemble Composition=Similar Size Models2026.05 | 60.67 | — | 0.6 | |
| ETTCEnsemble Composition=Similar Size Models2026.05 | 60.07 | — | — | |
| R1-VLSize=7B, Strategy=SFT+RL2025.11 | 60 | 221 | — | |
| IXC-2.5Size=7B2026.03 | 59.9 | — | — | |
| VotingEnsemble Composition=Similar Size Models2026.05 | 59.27 | — | — | |
| Our Base Model + Multi-AgentSize=7B, Multi-Agent=true2026.03 | 58.6 | — | — | |
| Qwen3.5-4B-InstTraining Paradigm=Vanilla Open-source, Parameters=4B2026.05 | 58.3 | — | — | |
| Qwen2.5-VL-7BTraining Paradigm=Vanilla Open-source, Parameters=7B2026.05 | 57.9 | — | — | |
| LLaVA-CoTSize=11B, Strategy=SFT2025.11 | 57.6 | 464 | — | |
| MiniCPM-V-2.6Size=7B2026.03 | 57.5 | — | — | |
| Insight-V-LLaVASize=8B, Base Model=LLaVA-NeXT-LLaMA3, Iterative DPO=true2026.03 | 57.4 | — | — | |
| Ovis1.5-LLaMA3Size=8B2026.03 | 57.3 | — | — | |
| Our Base ModelSize=7B2026.03 | 57 | — | — | |
| InternLM-XComposer2Size=7B2026.03 | 56.2 | — | — | |
| Idefics3-LLaMA3Size=8B2026.03 | 55.9 | — | — | |
| Average (Single-Model)Ensemble Composition=Same Family Models2026.05 | 54.22 | — | — | |
| LLaVA-NeXT-LLaMA3 + Multi-AgentSize=8B, Multi-Agent=true2026.03 | 52.6 | — | — | |
| MiniCPM-LLaMA3-V 2.5Size=8B2026.03 | 51.8 | — | — | |
| Average (Single-Model)Ensemble Composition=Similar Size Models2026.05 | 51.65 | — | — | |
| LLaVA-NeXT-LLaMA3Size=8B2026.03 | 43.1 | — | — | |
| VILA-1.5Size=8B2026.03 | 39.7 | — | — | |
| DeepSeek-VLSize=7B2026.03 | 37.1 | — | — | |
| D2-Pruning# Data=65K2025.04 | 36.63 | — | — | |
| COMPACT# Data=65K2025.04 | 36.13 | — | — | |
| ICONS# Data=65K2025.04 | 35.96 | — | — | |
| LLaVA-665K# Data=665K2025.04 | 35.11 | — | — | |
| Self-Sup# Data=65K2025.04 | 34.33 | — | — | |
| SemDeDup# Data=65K2025.04 | 34.18 | — | — | |
| Random# Data=65K2025.04 | 34.13 | — | — | |
| EL2N# Data=65K2025.04 | 33.82 | — | — | |
| Self-Filter# Data=65K2025.04 | 33.67 | — | — | |
| Perplexity# Data=65K2025.04 | 33.47 | — | — |