Vision-centric Reasoning on MMVP
86.3AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4omodel_category=Proprietary Model2025.09 | 86.3 | |
| Gemini2.0-Flashmodel_category=Proprietary Model2025.09 | 83 | |
| VisionZero-Qwen-7B (CLEVR)training_context=CLEVR, base_model=Qwen2.5-VL-7B2025.09 | 79.5 | |
| VisionZero-Qwen-7B (Real-World)training_context=Real-World, base_model=Qwen2.5-VL-7B2025.09 | 79.2 | |
| VisionZero-Qwen-7B (Chart)training_context=Chart, base_model=Qwen2.5-VL-7B2025.09 | 79.1 | |
| MiMo-VL-7B-SFTOpen Model=Yes, Open Data=No2025.11 | 78.33 | |
| MiMo-VL-7B-RLOpen Model=Yes, Open Data=No2025.11 | 77.67 | |
| Qwen2.5-VL-7B-Instruct + LongPerceptualThoughtsOpen Model=Yes, Open Data=Yes2025.11 | 77 | |
| Qwen2.5-VL-7Bbase_model=Qwen2.5-VL-7B2025.09 | 76.8 | |
| Qwen2.5-VL-7B-Instruct + VLAA-ThinkerOpen Model=Yes, Open Data=Yes2025.11 | 75 | |
| Qwen2.5-VL-7B-InstructOpen Model=Yes, Open Data=No2025.11 | 74.67 | |
| ViGaL-Snake+Rotationbase_model=Qwen2.5-VL-7B2025.09 | 74.6 | |
| MM-Eureka-Qwen-7Bbase_model=Qwen2.5-VL-7B2025.09 | 74.3 | |
| Long Grounded Thoughts (SFT + DPO)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 74 | |
| Long Grounded Thoughts (SFT)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 73.67 | |
| Long Grounded Thoughts (Multistage SFT + DPO)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 72.33 | |
| Long Grounded Thoughts (SFT + GRPO)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 72 | |
| VLAA-Thinker-7Bbase_model=Qwen2.5-VL-7B2025.09 | 71.6 | |
| OpenVLThinker-7Bbase_model=Qwen2.5-VL-7B2025.09 | 71.3 | |
| Qwen2.5-VL-7B-Instruct + Revisual-R1-finalOpen Model=Yes, Open Data=Yes2025.11 | 65.33 | |
| R1-OneVision-7Bbase_model=Qwen2.5-VL-7B2025.09 | 61.3 |