Multimodal Model Evaluation on MMBench
87.8AccuracyAdaTooler-V-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AdaTooler-V-7BParameters=7B2025.12 | 87.8 | — | |
| EMOVAModel Size=72B2024.09 | 86.4 | — | |
| SophiaVL-R1-7BParameters=7B2025.12 | 85.4 | — | |
| Qwen3-VLToken Ratio=Full Tokens2026.06 | 84.7 | — | |
| GPT-4o2024.09 | 83.4 | — | |
| InternVL3-8BParameters=8B2025.12 | 83.4 | — | |
| Qwen2.5-VL-7B-InstructParameters=7B2025.12 | 83.4 | — | |
| EMOVAModel Size=7B2024.09 | 83 | — | |
| FP16 (Baseline)Backbone=Qwen 2.5 VL 7B, Avg. Bit width=162025.09 | 82.6 | — | |
| GPT-4oCategory=Proprietary2025.12 | 82.1 | — | |
| Qwen2.5-VL-7BRatio=100%, Backbone=Qwen2.5-VL-7B2026.05 | 82.1 | — | |
| VisPrunerToken Ratio=33.3%2026.06 | 81.8 | — | |
| VisionZipRatio=60%, Backbone=Qwen2.5-VL-7B2026.05 | 81.69 | — | |
| DivPruneRatio=60%, Backbone=Qwen2.5-VL-7B2026.05 | 81.44 | — | |
| OmniQuantBackbone=Qwen 2.5 VL 7B, Avg. Bit width=42025.09 | 81.3 | — | |
| CDPrunerRatio=60%, Backbone=Qwen2.5-VL-7B2026.05 | 81.28 | — | |
| F3ARatio=60%, Backbone=Qwen2.5-VL-7B2026.05 | 81.16 | — | |
| PriorTRToken Ratio=33.3%2026.06 | 81.1 | — | |
| F3ARatio=20%, Backbone=Qwen2.5-VL-7B2026.05 | 81 | — | |
| AWQBackbone=Qwen 2.5 VL 7B, Avg. Bit width=42025.09 | 80.9 | — | |
| LLaVA-OneVision-7BParameters=7B2025.12 | 80.8 | — | |
| VisionZipRatio=40%, Backbone=Qwen2.5-VL-7B2026.05 | 80.66 | — | |
| F3ARatio=40%, Backbone=Qwen2.5-VL-7B2026.05 | 80.52 | — | |
| FastVRatio=60%, Backbone=Qwen2.5-VL-7B2026.05 | 80.46 | — | |
| CDPrunerRatio=40%, Backbone=Qwen2.5-VL-7B2026.05 | 80.46 | — | |
| FastVToken Ratio=33.3%2026.06 | 80.4 | — | |
| GPTQBackbone=Qwen 2.5 VL 7B, Avg. Bit width=42025.09 | 80.2 | — | |
| DivPruneRatio=40%, Backbone=Qwen2.5-VL-7B2026.05 | 80.05 | — | |
| FastVRatio=40%, Backbone=Qwen2.5-VL-7B2026.05 | 79.64 | — | |
| PriorTRToken Ratio=22.2%2026.06 | 79.3 | — | |
| EMOVAModel Size=3B2024.09 | 79.2 | — | |
| CDPrunerRatio=20%, Backbone=Qwen2.5-VL-7B2026.05 | 78.41 | — | |
| PDropToken Ratio=33.3%2026.06 | 78.4 | — | |
| Qwen-VL-MAXLLM Size=Unk2024.03 | 78.1 | — | |
| VisPrunerToken Ratio=22.2%2026.06 | 78.1 | — | |
| VisionZipRatio=20%, Backbone=Qwen2.5-VL-7B2026.05 | 78 | — | |
| mPlug-Owl3LLM=Qwen-8B2024.11 | 77.6 | — | |
| DivPruneRatio=20%, Backbone=Qwen2.5-VL-7B2026.05 | 77.58 | — | |
| VisionLLM v2-chatBackbone=Vicuna-7B, #Data=22M2024.06 | 77.1 | — | |
| VITAModel Size=1.52024.09 | 76.6 | — | |
| FastVRatio=20%, Backbone=Qwen2.5-VL-7B2026.05 | 76.35 | — | |
| PaLI-X-VPDModel Scale=55B, Zero-shot=true2023.12 | 76.2 | — | |
| Baichuan-OmniModel Size=7B2024.09 | 76.2 | — | |
| PDropToken Ratio=22.2%2026.06 | 75.9 | — | |
| PriorTRToken Ratio=11.1%2026.06 | 75.7 | — | |
| Gemini ProLLM Size=Unk2024.03 | 75.2 | — | |
| FastVToken Ratio=22.2%2026.06 | 75.2 | — | |
| GPT-4VLLM Size=Unk2024.03 | 75 | — | |
| PaLI-X-InstructModel Scale=55B, Zero-shot=true2023.12 | 75 | — | |
| SliMELLM=Llama3-8B2024.11 | 75 | — | |
| Gemini Pro 1.52024.09 | 75 | — | |
| FocusLLaVALLM=Llama3-8B2024.11 | 74.7 | — | |
| ASMv2Model Scale=13B2024.02 | 74.4 | — | |
| LLaVA-NeXTLLM=Llama3-8B, implementation=ours2024.11 | 74.2 | — | |
| DeepSeek-VLLLM Size=7B2024.03 | 73.2 | — | |
| LLaVA-1.5LLM=Llama3-8B2024.11 | 72.9 | — | |
| MM1-7B-ChatBackbone=MM1-7B, #Data=>2B2024.06 | 72.3 | — | |
| Dragonfly (Ours)Backbone=Llama3-8B, #Data=2.9M2024.06 | 71.9 | — | |
| VITAModel Size=8x7B2024.09 | 71.8 | — | |
| VILA-13B + ShareGPT4VLLM=Llama-2-13B, Resolution=336, Pre-training samples=50M, Instruction tuning samples=1M2023.12 | 70.8 | — | |
| LLaVA-NeXT + MoVE-KD-v1.0LLM=Vicuna-13B, Model Scale=13B2025.01 | 70.6 | — | |
| VILALLM Size=13B2024.03 | 70.3 | — | |
| VILA-13BLLM=Llama-2-13B, Resolution=336, Pre-training samples=50M, Instruction tuning samples=1M2023.12 | 70.3 | — | |
| VILAModel Scale=13B2024.02 | 70.3 | — | |
| CaMML-13BLLM=Vicuna-13B, Data=558K++665K2024.01 | 70.2 | — | |
| LLaVA-1.5 + MoVE-KD-v1.0LLM=Vicuna-13B, Model Scale=13B2025.01 | 70.2 | — | |
| LLaVA-NextLLM Size=13B2024.03 | 70 | — | |
| LLaVA-NeXTLLM=Vicuna-13B, Model Scale=13B2025.01 | 70 | — | |
| LLaVA-1.5 + MoVE-KD-v1.1LLM=Vicuna-13B, Model Scale=13B2025.01 | 69.7 | — | |
| PaLI-3-VPDModel Scale=5B, Zero-shot=true2023.12 | 69 | — | |
| VILA-7BLLM=Llama-2-7B, Resolution=336, Pre-training samples=50M, Instruction tuning samples=1M2023.12 | 68.9 | — | |
| VILABackbone=Llama2-7B, #Data=61M2024.06 | 68.9 | — | |
| VILA-7BLLM=Llama-2-7B, Resolution=3362024.11 | 68.9 | — | |
| ShareGPT4V-7BBackbone=Vicuna-7B, #Data=1.8M2024.06 | 68.8 | — | |
| PaLI-3-InstructModel Scale=5B, Zero-shot=true2023.12 | 68.6 | — | |
| LLaVA-1.5-13BImg/s=2.22, Speedup=-2025.10 | 68.5 | — | |
| LLaVA-1.5LLM Size=13B2024.03 | 68.2 | — | |
| Yi-VLLLM Size=6B2024.03 | 68.2 | — | |
| LLaVA-UHD#Data=1.2M, MaxRes.=672x1008, AR.=Any, TFLOPS=14.62024.03 | 68 | — | |
| MoE-LLaVA-2.7Bx4-Top2†LLM=Phi-2-2.7B, Activated Parameters=3.6B, Resolution=3842024.01 | 68 | — | |
| LLaVA-v1.6 (7B) w/ STICBase Model=LLaVA-v1.6 (7B), Strategy=STIC2024.05 | 67.8 | — | |
| LLaVA-1.5#Data=1.2M, MaxRes.=336x336, AR.=Fix, TFLOPS=15.52024.03 | 67.7 | — | |
| LLAVA-1.5Model Scale=Vicuna-13B, Zero-shot=true2023.12 | 67.7 | — | |
| LLaVA-1.5LLM=Vicuna-1.5-13B, Resolution=336, Pre-training samples=0.6M, Instruction tuning samples=0.7M2023.12 | 67.7 | — | |
| LLaVA-v1.5-13BLLM=Vicuna-13B, Resolution=3362024.05 | 67.7 | — | |
| LLaVA-1.5LLM=Vicuna-13B, Data=558K+665K2024.01 | 67.7 | — | |
| LLaVA-1.5Model Scale=13B2024.02 | 67.7 | — | |
| LLaVA-1.5LLM=Vicuna-13B, Activated Parameters=13B, Resolution=3362024.01 | 67.7 | — | |
| LLaVA-1.5LLM=Vicuna-13B, Model Scale=13B2025.01 | 67.7 | — | |
| LLaVA-1.5-13BReduction Ratio=0, # Vis. tokens=5762026.02 | 67.7 | — | |
| LLaVA-NeXT + MoVE-KD-v1.0LLM=Vicuna-7B, Model Scale=7B2025.01 | 67.6 | — | |
| LLaVA-NextLLM Size=7B2024.03 | 67.4 | — | |
| LLaVA-NeXTBackbone=Vicuna-7B, #Data=1.2M2024.06 | 67.4 | — | |
| LLaVA-NeXTLLM=Vicuna-7B2024.11 | 67.4 | — | |
| TrimLLM=Vicuna-7B2024.11 | 67.4 | — | |
| LLaVA-1.5 + MoVE-KD-v1.1LLM=Vicuna-7B, Model Scale=7B2025.01 | 67.4 | — | |
| LLaVA-NeXTLLM=Vicuna-7B, Model Scale=7B2025.01 | 67.4 | — | |
| VisPrunerToken Ratio=11.1%2026.06 | 67.3 | — | |
| SPHINX#Data=1.0B, MaxRes.=448x448, AR.=Fix, TFLOPS=39.72024.03 | 66.9 | — | |
| CaMML-7BLLM=Vicuna-7B, Data=558K++665K2024.01 | 66.9 | — |