Visual Question Answering on MMBench-CN
93.13AccuracyGemini-2.5 (Pro)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini-2.5 (Pro)Model Tier=Pro2026.01 | 93.13 | — | |
| STEP3-VL-10B (PaCoRe)Reasoning Strategy=PaCoRe, Parameters=10B2026.01 | 91.96 | — | |
| GLM-4.6VParameters=106B-A12B2026.01 | 91.88 | — | |
| Qwen3-VL (Thinking)Thinking Mode=true, Parameters=235B-A22B2026.01 | 91.8 | — | |
| Seed-1.5-VL (Thinking)Thinking Mode=true2026.01 | 91.76 | — | |
| STEP3-VL-10B (SeRe)Reasoning Strategy=SeRe, Parameters=10B2026.01 | 91.55 | — | |
| VanillaModels=InternVL 2.5 8B, Average Tokens=100%2026.02 | 83.1 | 100 | |
| IVC-PruneModels=InternVL 2.5 8B, Average Tokens=50%2026.02 | 82.9 | 100 | |
| IVC-PruneModels=Qwen2.5-VL 7B, Average Tokens=50%2026.02 | 82.7 | 100.2 | |
| VanillaModels=Qwen2.5-VL 7B, Average Tokens=100%2026.02 | 82.2 | 100 | |
| GPT-4oModel Modality Type=Proprietary2024.10 | 82.1 | — | |
| Qwen2 VLModel Scale=7B, Model Modality Type=Vision-language2024.10 | 81.9 | — | |
| FastVModels=InternVL 2.5 8B, Average Tokens=53%2026.02 | 81.9 | 98.6 | |
| PDropModels=InternVL 2.5 8B, Average Tokens=56%2026.02 | 81.9 | 99.1 | |
| IXC-2.5-7BModel Size=7B2024.07 | 80.8 | — | |
| FastVModels=Qwen2.5-VL 7B, Average Tokens=54%2026.02 | 80.8 | 98.2 | |
| InternVL-1.5Model Size=1.5-26B, Access Type=Open-source2024.07 | 80.7 | — | |
| PDropModels=Qwen2.5-VL 7B, Average Tokens=61%2026.02 | 80.5 | 98 | |
| GPT-4VAccess Type=Closed-source API2024.07 | 80.2 | — | |
| IVC-PruneModels=DeepSeek-VL2 Small-16B, Average Tokens=52%2026.02 | 80.1 | 100.1 | |
| PDropModels=DeepSeek-VL2 Small-16B, Average Tokens=57%2026.02 | 79.8 | 100 | |
| VanillaModels=DeepSeek-VL2 Small-16B, Average Tokens=100%2026.02 | 79.7 | 100 | |
| FastVModels=DeepSeek-VL2 Small-16B, Average Tokens=54%2026.02 | 78.5 | 98.8 | |
| Baichuan-omniModel Scale=7B, Model Modality Type=Omni-modal2024.10 | 74.9 | — | |
| Gemini-ProAccess Type=Closed-source API2024.07 | 74.3 | — | |
| MiniCPM-Llama3-V 2.5Model Scale=8B, Model Modality Type=Vision-language2024.10 | 73.3 | — | |
| VITAModel Scale=8x7B, Model Modality Type=Omni-modal2024.10 | 71.4 | — | |
| TinyLLaVA†LLM=Qwen2.5-3B2026.07 | 70.4 | — | |
| TRAGLLM=Qwen2.5-1.5B2026.07 | 69.3 | — | |
| TinyLLaVA†LLM=Qwen1.5-4B2026.07 | 67.2 | — | |
| LLaVA-KDLLM=Qwen2.5-1.5B2026.07 | 66.6 | — | |
| LLaVA-MoDLLM=Qwen2-1.5B2026.07 | 64.4 | — | |
| TinyLLaVA†LLM=Qwen2.5-1.5B2026.07 | 64 | — | |
| LLaVA-KDLLM=Qwen1.5-1.8B2026.07 | 63.7 | — | |
| LLaVA-1.5-13BLLM=Vicuna-13B, Image Size=336x336, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 63.6 | — | |
| VanillaRetained Tokens=576, Compression Ratio=100%2026.04 | 63.6 | — | |
| TRAGLLM=Qwen1.5-1.8B2026.07 | 63.3 | — | |
| KD†LLM=Qwen1.5-1.8B2026.07 | 63.1 | — | |
| CompoDistill†LLM=Qwen1.5-1.8B2026.07 | 63 | — | |
| MiniCPM-VLLM=MiniCPM-2.4B2026.07 | 62.7 | — | |
| LLaVA-1.5-13B-HDLLM=Vicuna-13B, Image Size=448x448, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 61.9 | — | |
| Imp-2BLLM=Qwen1.5-1.8B2026.07 | 61.3 | — | |
| VisionZipRetained Tokens=64, Compression Ratio=88.9%2026.04 | 61.1 | — | |
| DARTRetained Tokens=64, Compression Ratio=88.9%2026.04 | 61 | — | |
| EvoComp (l = 2)Retained Tokens=64, Compression Ratio=88.9%, Compressor layers (l)=2, Transfer setting=from LLaVA-1.5-7B to LLaVA-1.5-13B2026.04 | 60.8 | — | |
| EvoComp (l = 0)Retained Tokens=64, Compression Ratio=88.9%, Compressor layers (l)=0, Transfer setting=from LLaVA-1.5-7B to LLaVA-1.5-13B2026.04 | 60.2 | — | |
| FastVRetained Tokens=64, Compression Ratio=88.9%2026.04 | 60.1 | — | |
| SparseVLM-v1.5Token Retention Rate=128, Base Model=LLaVA-1.5-7B2025.06 | 58.86 | — | |
| SparseVLMRetained Tokens=64, Compression Ratio=88.9%2026.04 | 58.8 | — | |
| SparseVLM-v1.5Token Retention Rate=192, Base Model=LLaVA-1.5-7B2025.06 | 58.69 | — | |
| LLaVA-1.5-7BToken Retention Rate=576, Base Model=LLaVA-1.5-7B2025.06 | 58.63 | — | |
| Bunny-2BLLM=Qwen1.5-1.8B2026.07 | 58.5 | — | |
| VisionDropToken Retention Rate=192, Base Model=LLaVA-1.5-7B2025.06 | 58.41 | — | |
| LLaVA-1.5-7BLLM=Vicuna-7B, Image Size=336x336, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 58.3 | — | |
| MustDropRetained Tokens=64, Compression Ratio=88.9%2026.04 | 57.9 | — | |
| TRAGLLM=Qwen2.5-0.5B2026.07 | 57.7 | — | |
| VisPrunerToken Retention Rate=192, Base Model=LLaVA-1.5-7B2025.06 | 57.62 | — | |
| MoE-LLaVA-2BLLM=Qwen1.5-1.8B2026.07 | 57.3 | — | |
| VisionZipToken Retention Rate=192, Base Model=LLaVA-1.5-7B2025.06 | 57.29 | — | |
| DART (l = 0)Retained Tokens=64, Compression Ratio=88.9%, Compressor layers (l)=02026.04 | 57.2 | — | |
| VisionDropToken Retention Rate=128, Base Model=LLaVA-1.5-7B2025.06 | 57.06 | — | |
| LLaVA-KDLLM=Qwen2.5-0.5B2026.07 | 57 | — | |
| Qwen-VL-ChatLLM=Qwen-7B, Image Size=448x448, Pre-train Sample Size=1.4B*, Fine-tune Sample Size=50M+2023.10 | 56.7 | — | |
| VisionZipToken Retention Rate=128, Base Model=LLaVA-1.5-7B2025.06 | 56.67 | — | |
| VisPrunerToken Retention Rate=128, Base Model=LLaVA-1.5-7B2025.06 | 56.67 | — | |
| PDropToken Retention Rate=192, Base Model=LLaVA-1.5-7B2025.06 | 56.28 | — | |
| TinyLLaVA†LLM=Qwen1.5-1.8B2026.07 | 56.2 | — | |
| LLaVA-KDLLM=Qwen1.5-0.5B2026.07 | 55.5 | — | |
| VisionDropToken Retention Rate=64, Base Model=LLaVA-1.5-7B2025.06 | 55.1 | — | |
| CompoDistill†LLM=Qwen1.5-0.5B2026.07 | 54.9 | — | |
| TRAGLLM=Qwen1.5-0.5B2026.07 | 54.6 | — | |
| VisPrunerToken Retention Rate=64, Base Model=LLaVA-1.5-7B2025.06 | 54.48 | — | |
| PDropToken Retention Rate=128, Base Model=LLaVA-1.5-7B2025.06 | 54.32 | — | |
| VisionZipToken Retention Rate=64, Base Model=LLaVA-1.5-7B2025.06 | 54.2 | — | |
| LLaVA-MoDLLM=Qwen2-0.5B2026.07 | 54.1 | — | |
| PyramidDropRetained Tokens=64, Compression Ratio=88.9%2026.04 | 53 | — | |
| VisionDropToken Retention Rate=32, Base Model=LLaVA-1.5-7B2025.06 | 52.91 | — | |
| TinyLLaVA†LLM=Qwen2.5-0.5B2026.07 | 52.4 | — | |
| SparseVLM-v1.5Token Retention Rate=64, Base Model=LLaVA-1.5-7B2025.06 | 52.13 | — | |
| TinyLLaVA†LLM=Qwen1.5-0.5B2026.07 | 51.8 | — | |
| Mini-Gemini-2BLLM=Gemma-2B2026.07 | 51.3 | — | |
| VisPrunerToken Retention Rate=32, Base Model=LLaVA-1.5-7B2025.06 | 50.78 | — | |
| VisionZipToken Retention Rate=32, Base Model=LLaVA-1.5-7B2025.06 | 49.78 | — | |
| KD†LLM=Qwen1.5-0.5B2026.07 | 49.7 | — | |
| FastVToken Retention Rate=128, Base Model=LLaVA-1.5-7B2025.06 | 49.05 | — | |
| FastVToken Retention Rate=192, Base Model=LLaVA-1.5-7B2025.06 | 48.43 | — | |
| Imp-3BLLM=Phi2-2.7B2026.07 | 46.7 | — | |
| PDropToken Retention Rate=64, Base Model=LLaVA-1.5-7B2025.06 | 43.83 | — | |
| FastVToken Retention Rate=64, Base Model=LLaVA-1.5-7B2025.06 | 43.27 | — | |
| IVC-PruneModels=LLaVA-v1.5 7B, Average Tokens=28%2026.02 | 43 | 101.3 | |
| FastVModels=LLaVA-v1.5 7B, Average Tokens=30%2026.02 | 42.2 | 99.7 | |
| PDropModels=LLaVA-v1.5 7B, Average Tokens=47%2026.02 | 42.1 | 99.8 | |
| VanillaModels=LLaVA-v1.5 7B, Average Tokens=100%2026.02 | 41.8 | 100 | |
| IDEFICS-80BLLM=LLaMA-65B, Image Size=224x224, Pre-train Sample Size=353M, Fine-tune Sample Size=1M2023.10 | 38.1 | — | |
| BunnyLLM=Phi2-2.7B2026.07 | 37.2 | — | |
| LLaVA-7BLLM=Vicuna-7B2023.10 | 36.4 | — | |
| IDEFICS-9BLLM=LLAMA-7B, Image Size=224x224, Pre-train Sample Size=353M, Fine-tune Sample Size=1M2023.10 | 25.2 | — | |
| InstructBLIP-8BLLM=Vicuna-7B, Image Size=224x224, Pre-train Sample Size=129M, Fine-tune Sample Size=1.2M2023.10 | 23.7 | — | |
| Qwen-VLLLM=Qwen-7B, Image Size=448x448, Pre-train Sample Size=1.4B+, Fine-tune Sample Size=50M+2023.10 | 7.4 | — |