Visual Question Answering on MMBench English
93.19AccuracyGemini-2.5 (Pro)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini-2.5 (Pro)Model Tier=Pro2026.01 | 93.19 | — | |
| GLM-4.6VParameters=106B-A12B2026.01 | 92.75 | — | |
| Qwen3-VL (Thinking)Thinking Mode=true, Parameters=235B-A22B2026.01 | 92.7 | — | |
| STEP3-VL-10B (PaCoRe)Reasoning Strategy=PaCoRe, Parameters=10B2026.01 | 92.38 | — | |
| Seed-1.5-VL (Thinking)Thinking Mode=true2026.01 | 92.11 | — | |
| STEP3-VL-10B (SeRe)Reasoning Strategy=SeRe, Parameters=10B2026.01 | 92.05 | — | |
| VanillaModels=InternVL 2.5 8B, Average Tokens=100%2026.02 | 83.9 | 100 | |
| IVC-PruneModels=InternVL 2.5 8B, Average Tokens=50%2026.02 | 83.9 | 100 | |
| IVC-PruneModels=Qwen2.5-VL 7B, Average Tokens=50%2026.02 | 83.8 | 100.2 | |
| VanillaBackbone=QWEN-2.5-VL 7B, Average Tokens=100%2026.02 | 83.5 | — | |
| VanillaModels=Qwen2.5-VL 7B, Average Tokens=100%2026.02 | 83.4 | 100 | |
| PDropModels=InternVL 2.5 8B, Average Tokens=56%2026.02 | 83.4 | 99.1 | |
| NuwaBackbone=QWEN-2.5-VL 7B, Average Tokens=75%2026.02 | 83.13 | — | |
| NuwaBackbone=QWEN-2.5-VL 7B, Average Tokens=50%2026.02 | 83.02 | — | |
| FastVModels=InternVL 2.5 8B, Average Tokens=53%2026.02 | 82.5 | 98.6 | |
| NuwaBackbone=QWEN-2.5-VL 7B, Average Tokens=25%2026.02 | 82.47 | — | |
| FastVModels=Qwen2.5-VL 7B, Average Tokens=54%2026.02 | 81.8 | 98.2 | |
| PDropModels=Qwen2.5-VL 7B, Average Tokens=61%2026.02 | 80.8 | 98 | |
| VanillaModels=DeepSeek-VL2 Small-16B, Average Tokens=100%2026.02 | 80.8 | 100 | |
| PDropModels=DeepSeek-VL2 Small-16B, Average Tokens=57%2026.02 | 80.8 | 100 | |
| IVC-PruneModels=DeepSeek-VL2 Small-16B, Average Tokens=52%2026.02 | 80.8 | 100.1 | |
| FastVModels=DeepSeek-VL2 Small-16B, Average Tokens=54%2026.02 | 79.7 | 98.8 | |
| LLaVA-1.5-13B-HDLLM=Vicuna-13B, Image Size=448x448, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 68.8 | — | |
| LLaVA-1.5-13BLLM=Vicuna-13B, Image Size=336x336, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 67.7 | — | |
| LLaVA-1.5-7BLLM=Vicuna-7B, Image Size=336x336, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 64.3 | — | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B, Visual Token Budget=5762026.07 | 64 | — | |
| SparseVLMBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.07 | 63.5 | — | |
| VanillaModels=LLaVA-v1.5 7B, Average Tokens=100%2026.02 | 63.3 | 100 | |
| IVC-PruneModels=LLaVA-v1.5 7B, Average Tokens=28%2026.02 | 63.3 | 101.3 | |
| AnchorPruneBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.07 | 63.3 | — | |
| PDropModels=LLaVA-v1.5 7B, Average Tokens=47%2026.02 | 62.8 | 99.8 | |
| PyramidDropBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.07 | 62.7 | — | |
| DivPruneBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.07 | 62.6 | — | |
| FastVModels=LLaVA-v1.5 7B, Average Tokens=30%2026.02 | 62.5 | 99.7 | |
| FastVBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.07 | 62.5 | — | |
| VisionZipBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.07 | 62.4 | — | |
| CDPrunerBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.07 | 62.4 | — | |
| AnchorPruneBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.07 | 61.3 | — | |
| CDPrunerBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.07 | 61.2 | — | |
| Qwen-VL-ChatLLM=Qwen-7B, Image Size=448x448, Pre-train Sample Size=1.4B*, Fine-tune Sample Size=50M+2023.10 | 60.6 | — | |
| PruMerge+Backbone=LLaVA-1.5-7B, Visual Token Budget=1282026.07 | 60.1 | — | |
| FastVBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.07 | 60.1 | — | |
| CDPrunerBackbone=LLaVA-1.5-7B, Visual Token Budget=322026.07 | 60.1 | — | |
| AnchorPruneBackbone=LLaVA-1.5-7B, Visual Token Budget=322026.07 | 60.1 | — | |
| VisionZipBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.07 | 60 | — | |
| SparseVLMBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.07 | 59.9 | — | |
| DivPruneBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.07 | 59.2 | — | |
| Shikra-13BLLM=Vicuna-13B, Image Size=224x224, Pre-train Sample Size=600K, Fine-tune Sample Size=5.5M2023.10 | 58.8 | — | |
| PruMerge+Backbone=LLaVA-1.5-7B, Visual Token Budget=642026.07 | 58.8 | — | |
| PyramidDropBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.07 | 58.2 | — | |
| DivPruneBackbone=LLaVA-1.5-7B, Visual Token Budget=322026.07 | 57.9 | — | |
| VisionZipBackbone=LLaVA-1.5-7B, Visual Token Budget=322026.07 | 57.2 | — | |
| PruMerge+Backbone=LLaVA-1.5-7B, Visual Token Budget=322026.07 | 56.4 | — | |
| IDEFICS-80BLLM=LLaMA-65B, Image Size=224x224, Pre-train Sample Size=353M, Fine-tune Sample Size=1M2023.10 | 54.5 | — | |
| IDEFICS-9BLLM=LLAMA-7B, Image Size=224x224, Pre-train Sample Size=353M, Fine-tune Sample Size=1M2023.10 | 48.2 | — | |
| LLaVA-7BLLM=Vicuna-7B2023.10 | 38.7 | — | |
| Qwen-VLLLM=Qwen-7B, Image Size=448x448, Pre-train Sample Size=1.4B+, Fine-tune Sample Size=50M+2023.10 | 38.2 | — | |
| InstructBLIP-8BLLM=Vicuna-7B, Image Size=224x224, Pre-train Sample Size=129M, Fine-tune Sample Size=1.2M2023.10 | 36 | — |