Visual Perception on MMStar
73.07AccuracyQwen3-VL-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VL-8BTraining=Staged2026.05 | 73.07 | |
| OneThinker-8BTraining=Base2026.05 | 70.2 | |
| Qwen3-VL-8BTraining=Base2026.05 | 70 | |
| V-ZeroBackbone=Qwen2.5-VL-7B-Instruct, Iteration=12026.01 | 65.7 | |
| V-ZeroBackbone=Qwen2.5-VL-7B-Instruct, Iteration=22026.01 | 65.1 | |
| WeThink-7BTraining=Base2026.05 | 64.67 | |
| GThinker-7BTraining=Base2026.05 | 64.6 | |
| Supervised GRPOBackbone=Qwen2.5-VL-7B-Instruct2026.01 | 64.5 | |
| Qwen2.5-VL-7BTraining=Base2026.05 | 64.4 | |
| Qwen2.5-VL-7BTraining=Staged2026.05 | 64.07 | |
| Qwen2.5-VL-7B-Instruct (Base)Backbone=Qwen2.5-VL-7B-Instruct, Training Strategy=Base Model2026.01 | 63.9 | |
| MMR1-7BTraining=Base2026.05 | 63.67 | |
| OpenVLThinker-7BTraining=Base2026.05 | 63.4 | |
| OpenVLThinker-7BBackbone=Qwen2.5-VL-7B-Instruct2026.01 | 59.6 | |
| R1-OneVision-RL-7BTraining=Base2026.05 | 58.13 | |
| V-ZeroBackbone=Qwen2.5-VL-3B-Instruct, Iteration=22026.01 | 56.4 | |
| Qwen2.5-VL-3B-Instruct (Base)Backbone=Qwen2.5-VL-3B-Instruct2026.01 | 56.1 | |
| V-ZeroBackbone=Qwen2.5-VL-3B-Instruct, Iteration=12026.01 | 54.7 | |
| GPT-4V2024.06 | 49.7 | |
| MG-LLaVALLM=Yi1.5-34B, Params.=34.4B, Res.=336 (768)2024.06 | 47.9 | |
| Qwen-VL-Plus2024.06 | 39.7 | |
| MiniCPM-V2LLM=MiniCPM-2.4B, Params.=2.8B, Res.=4482024.06 | 39.1 | |
| GeminiPro Vision2024.06 | 38.6 | |
| Qwen-VL-ChatLLM=Qwen-7B, Params.=9.6B, Res.=4482024.06 | 37.5 | |
| MG-LLaVALLM=LLaMA3-8B, Params.=8.4B, Res.=336 (768)2024.06 | 36.9 | |
| MG-LLaVALLM=Phi3-3.8B, Params.=4.2B, Res.=336 (768)2024.06 | 35.5 | |
| MG-LLaVALLM=Vicuna-7B, Params.=7.4B, Res.=336 (768)2024.06 | 35.1 | |
| MG-LLaVALLM=Vicuna-13B, Params.=13.6B, Res.=336 (768)2024.06 | 34.1 | |
| LLaVA-1.5LLM=Vicuna-13B, Params.=13.4B, Res.=3362024.06 | 32.8 | |
| LLaVA-1.5LLM=Vicuna-7B, Params.=7.2B, Res.=3362024.06 | 30.3 |