Multimodal Understanding on MME-RealWorld Chinese
64.3AccuracyMiMo-VL-7B-SFT-2508
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MiMo-VL-7B-SFT-2508Chain-of-thought reasoning=false2025.12 | 64.3 | — | |
| MiMo-VL-Miloco-7BChain-of-thought reasoning=false2025.12 | 61.4 | — | |
| InternVL3-8BChain-of-thought reasoning=false2025.12 | 58.5 | — | |
| Full PrecModel Backbone=Qwen2-VL-7B-Instruct, Quantization Method=Full Precision, Quantization Bit-width/Group-size=None, Zero-shot=true2025.08 | 56.09 | — | |
| VLMQModel Backbone=Qwen2-VL-7B-Instruct, Quantization Method=VLMQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 55.47 | — | |
| Full PrecModel Backbone=LLaVA-OneVision-7B, Quantization Method=Full Precision, Quantization Bit-width/Group-size=None, Zero-shot=true2025.08 | 53.93 | — | |
| Full PrecModel Backbone=Qwen2.5-VL-7B-Instruct, Quantization Method=Full Precision, Quantization Bit-width/Group-size=None, Zero-shot=true2025.08 | 52.98 | — | |
| GPTAQModel Backbone=Qwen2-VL-7B-Instruct, Quantization Method=GPTAQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 52.12 | — | |
| VLMQModel Backbone=LLaVA-OneVision-7B, Quantization Method=VLMQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 51.48 | — | |
| Qwen2.5-VL-7BChain-of-thought reasoning=false2025.12 | 51.2 | — | |
| GPTAQModel Backbone=LLaVA-OneVision-7B, Quantization Method=GPTAQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 50.53 | — | |
| MBQModel Backbone=Qwen2-VL-7B-Instruct, Quantization Method=MBQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 50.5 | — | |
| AWQModel Backbone=Qwen2-VL-7B-Instruct, Quantization Method=AWQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 49.97 | — | |
| GPTQModel Backbone=LLaVA-OneVision-7B, Quantization Method=GPTQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 49.64 | — | |
| GPTQModel Backbone=Qwen2-VL-7B-Instruct, Quantization Method=GPTQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 49.21 | — | |
| VLMQModel Backbone=Qwen2.5-VL-7B-Instruct, Quantization Method=VLMQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 48.74 | — | |
| Gemma-3-27B-ITChain-of-thought reasoning=false2025.12 | 47.9 | — | |
| GPTQModel Backbone=Qwen2.5-VL-7B-Instruct, Quantization Method=GPTQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 47.39 | — | |
| GPTAQModel Backbone=Qwen2.5-VL-7B-Instruct, Quantization Method=GPTAQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 44.33 | — | |
| Full PrecModel Backbone=Qwen2-VL-2B-Instruct, Quantization Method=Full Precision, Quantization Bit-width/Group-size=None, Zero-shot=true2025.08 | 43.59 | — | |
| VLMQModel Backbone=Qwen2-VL-2B-Instruct, Quantization Method=VLMQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 42.4 | — | |
| GPTAQModel Backbone=Qwen2-VL-2B-Instruct, Quantization Method=GPTAQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 42.1 | — | |
| GPTQModel Backbone=Qwen2-VL-2B-Instruct, Quantization Method=GPTQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 35.54 | — | |
| MBQModel Backbone=Qwen2-VL-2B-Instruct, Quantization Method=MBQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 33.45 | — | |
| AWQModel Backbone=Qwen2-VL-2B-Instruct, Quantization Method=AWQ, Quantization Bit-width/Group-size=INT3g128, Zero-shot=true2025.08 | 31.89 | — | |
| AndesVLNumber of Parameters=2.4B2025.12 | — | 56.7 | |
| HyperVLNumber of Parameters=1.8B2025.12 | — | 54.4 | |
| HyperVL ViTLNumber of Parameters=2.0B2025.12 | — | 52.9 | |
| Innovator-VLvariant=8B-Instruct, parameters=8B2026.01 | — | 57.99 | |
| Innovator-VLvariant=8B-Thinking, parameters=8B2026.01 | — | 62.26 | |
| Intern-S1variant=mini, parameters=9B2026.01 | — | 52.75 | |
| InternVL3Number of Parameters=2.1B2025.12 | — | 47.5 | |
| InternVL3.5parameters=8B2026.01 | — | 60.57 | |
| InternVL3.5Number of Parameters=2.3B2025.12 | — | 35.9 | |
| LLaVA-OVversion=1.5, parameters=8B2026.01 | — | 54.64 | |
| MiMo-VLtraining=7B-SFT, parameters=7B2026.01 | — | 44.18 | |
| MiMo-VLtraining=7B-RL, parameters=7B2026.01 | — | 46.68 | |
| MiniCPM-Vversion=4.5, parameters=8B2026.01 | — | 55.37 | |
| Ovis2Number of Parameters=2.5B2025.12 | — | 52.3 | |
| Qwen2-VLNumber of Parameters=2.2B2025.12 | — | 44.3 | |
| Qwen3-VLparameters=8B2026.01 | — | 64.53 | |
| Qwen3-VLNumber of Parameters=2.1B2025.12 | — | 55.2 | |
| SAIL-VL1.5Number of Parameters=2.5B2025.12 | — | 47.9 | |
| SAIL-VL2Number of Parameters=2.7B2025.12 | — | 59.5 |