Multimodal Understanding on MMBench (MMB)
86.3AccuracyVLsI-7B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VLsI-7BParameters=7B2024.12 | 86.3 | — | — | — | |
| Phantom-7BParameters=7B2024.12 | 84.8 | — | — | — | |
| TroL-7BParameters=7B2024.12 | 83.5 | — | — | — | |
| VisionZipTokens Retained Percentage=33.3%2025.03 | 83.4 | — | — | — | |
| Qwen2-VL-7BParameters=7B2024.12 | 83 | — | — | — | |
| Q2.5VL-7BTokens Retained Percentage=100%2025.03 | 82.7 | — | — | — | |
| TwigVLM++Tokens Retained Percentage=33.3%2025.03 | 82.7 | — | — | — | |
| VisionZipTokens Retained Percentage=22.2%2025.03 | 82.6 | — | — | — | |
| TwigVLM++Tokens Retained Percentage=22.2%2025.03 | 82.1 | — | — | — | |
| InternVL2-8BParameters=8B2024.12 | 81.7 | — | — | — | |
| FastVTokens Retained Percentage=33.3%2025.03 | 80.9 | — | — | — | |
| LLaVA-OneVision-7BParameters=7B2024.12 | 80.8 | — | — | — | |
| CogVLM2-8BParameters=8B2024.12 | 80.5 | — | — | — | |
| TwigVLMTokens Retained Percentage=33.3%2025.03 | 79.4 | — | — | — | |
| VisionZipTokens Retained Percentage=11.1%2025.03 | 79.2 | — | — | — | |
| Qwen2-VL 7BBackbone=Qwen2-VL 7B, Sparsity Level=0%, Pruning Method=Dense, Pruning Type=None2026.03 | 78.95 | — | — | 100 | |
| TwigVLM++Tokens Retained Percentage=11.1%2025.03 | 78.7 | — | — | — | |
| FastVTokens Retained Percentage=22.2%2025.03 | 78.6 | — | — | — | |
| TwigVLMTokens Retained Percentage=22.2%2025.03 | 77.4 | — | — | — | |
| MiniCPM-V2.5-8BParameters=8B2024.12 | 77.2 | — | — | — | |
| Idefics2-8BLLM Parameters=8B, Vision Tower Parameters=400M, Tokens per image=320, Pre-training data size=>600M2024.07 | 76.7 | — | — | — | |
| VILA2-8BParameters=8B2024.12 | 76.6 | — | — | — | |
| VILA2-8BLLM Parameters=8B, Vision Tower Parameters=400M, Tokens per image=196, Pre-training data size=51M2024.07 | 76.6 | — | — | — | |
| Cambrian-1-8BParameters=8B2024.12 | 75.9 | — | — | — | |
| Eagle-8BParameters=8B2024.12 | 75.9 | — | — | — | |
| Cambrian-1-13BParameters=13B2024.12 | 75.7 | — | — | — | |
| Eagle-13BParameters=13B2024.12 | 75.7 | — | — | — | |
| VILA1.5-8BParameters=8B2024.12 | 75.3 | — | — | — | |
| VILA1.5-13BParameters=13B2024.12 | 74.9 | — | — | — | |
| MM1-MoE-7B×32Parameters=7B×322024.12 | 72.7 | — | — | — | |
| MM1-7BParameters=7B2024.12 | 72.3 | — | — | — | |
| MM1-7B-ChatLLM Parameters=7B, Vision Tower Parameters=300M, Tokens per image=720, Pre-training data size=>2B2024.07 | 72.3 | — | — | — | |
| LLaVA-NeXT 8BBackbone=LLaVA-NeXT 8B, Sparsity Level=0%, Pruning Method=Dense, Pruning Type=None2026.03 | 72.16 | — | — | 100 | |
| LLaVA-NeXT 8B, DenseBackbone=LLaVA-NeXT 8B, Sparsity Pattern=Dense, Sparsity Type=N/A2026.03 | 72.16 | — | — | — | |
| LLaVA-NeXT-8BParameters=8B2024.12 | 72.1 | — | — | — | |
| ATV-PruningBackbone=Qwen2-VL 7B, Sparsity Level=60%, Pruning Method=ATV-Pruning, Pruning Type=unstructured, uniform pruning2026.03 | 71.82 | — | — | 85.65 | |
| SparseGPTBackbone=Qwen2-VL 7B, Sparsity Level=60%, Pruning Method=SparseGPT, Pruning Type=unstructured, uniform pruning2026.03 | 71.13 | — | — | 85.3 | |
| TAMPBackbone=Qwen2-VL 7B, Sparsity Level=60%, Pruning Method=TAMP, Pruning Type=unstructured, uniform pruning2026.03 | 70.02 | — | — | 83.79 | |
| LLaVA-NeXT-13BParameters=13B2024.12 | 70 | — | — | — | |
| LLaVA-NeXT-7BParameters=7B2024.12 | 69.6 | — | — | — | |
| WandaBackbone=Qwen2-VL 7B, Sparsity Level=60%, Pruning Method=Wanda, Pruning Type=unstructured, uniform pruning2026.03 | 69.42 | — | — | 77.78 | |
| MiniGemini-HD-13BParameters=13B2024.12 | 68.6 | — | — | — | |
| LLaVA-NeXT-7BRetained Tokens=2880, Base Model=LLaVA-NeXT-7B2025.03 | 67.9 | — | — | — | |
| LLaVA 1.5res=336x336, #tokens=5762024.01 | 67.7 | — | — | — | |
| VanillaBase Model=LLaVA 1.5 13B, Tokens Retained=576, Projector Fine-tuning=false2024.12 | 67.7 | — | — | — | |
| VanillaBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 67.7 | — | — | — | |
| VanillaBackbone=LLaVA-v1.5 13B, Token Retention Budget=576, Token Retention Ratio=100%2026.05 | 67.7 | 100 | — | — | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=128, Projector Fine-tuning=true2024.12 | 67.6 | — | — | — | |
| TwigVLM++Retained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 67.6 | — | — | — | |
| TokenPackerBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 67.4 | — | — | — | |
| QMoPBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 67.4 | — | — | — | |
| TwigVLMRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 67.4 | — | — | — | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=192, Projector Fine-tuning=true2024.12 | 67.1 | — | — | — | |
| TwigVLMTokens Retained Percentage=11.1%2025.03 | 67 | — | — | — | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=192, Projector Fine-tuning=false2024.12 | 66.9 | — | — | — | |
| LDP-v2Backbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 66.9 | — | — | — | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=128, Projector Fine-tuning=false2024.12 | 66.7 | — | — | — | |
| VisionZipBackbone=LLaVA-v1.5 13B, Token Retention Budget=128, Token Retention Ratio=22.2%2026.05 | 66.7 | 97.1 | — | — | |
| TwigVLM++Retained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 66.6 | — | — | — | |
| FasterVLMBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 66.4 | — | — | — | |
| VisionZipRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 66.3 | — | — | — | |
| LDP-v2Backbone=LLaVA-1.5-7B, Vision token count=642026.03 | 66.2 | — | — | — | |
| Pixel-ShuffleBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 66.2 | — | — | — | |
| OccamTokenBackbone=LLaVA-v1.5 13B, Token Retention Budget=128, Token Retention Ratio=22.2%2026.05 | 66.2 | 98.8 | — | — | |
| VisionZip‡Retained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 65.9 | — | — | — | |
| MiniGemini-HD-7BParameters=7B2024.12 | 65.8 | — | — | — | |
| FastVRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 65.8 | — | — | — | |
| OccamTokenBackbone=LLaVA-v1.5 13B, Token Retention Budget=64, Token Retention Ratio=11.1%2026.05 | 65.8 | 97.9 | — | — | |
| SparseVLMRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 65.7 | — | — | — | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=64, Projector Fine-tuning=true2024.12 | 65.6 | — | — | — | |
| LLaVA 1.5 + I-MoFres=336x336, #tokens=11522024.01 | 65.4 | — | — | — | |
| Dynamic-LLaVASparsity Op.=false, Sparsity Tok.=true, Vision-side Token=115, Vision-side TFLOPs (Rel.)=1.50 (19.6%)2026.02 | 65.4 | — | — | — | |
| SparseGPTBackbone=LLaVA-NeXT 8B, Sparsity Level=50%, Pruning Method=SparseGPT, Pruning Type=unstructured, uniform pruning2026.03 | 65.38 | — | — | 91.74 | |
| ATV-PruningBackbone=LLaVA-NeXT 8B, Sparsity Level=50%, Pruning Method=ATV-Pruning, Pruning Type=unstructured, uniform pruning2026.03 | 65.29 | — | — | 94 | |
| LDP-v2Backbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 65.1 | — | — | — | |
| TokenPackerBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 65 | — | — | — | |
| TwigVLMRetained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 65 | — | — | — | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=64, Projector Fine-tuning=false2024.12 | 64.9 | — | — | — | |
| VisionZipBackbone=LLaVA-v1.5 13B, Token Retention Budget=64, Token Retention Ratio=11.1%2026.05 | 64.9 | 93.6 | — | — | |
| TAMPBackbone=LLaVA-NeXT 8B, Sparsity Level=50%, Pruning Method=TAMP, Pruning Type=unstructured, uniform pruning2026.03 | 64.86 | — | — | 92.67 | |
| QMoPBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 64.8 | — | — | — | |
| LLaVA-1.5-7BSparsity Op.=false, Sparsity Tok.=false, Vision-side Token=576, Vision-side TFLOPs (Rel.)=7.65 (100.0%)2026.02 | 64.7 | — | — | — | |
| DARTSparsity Op.=false, Sparsity Tok.=true, Vision-side Token=64, Vision-side TFLOPs (Rel.)=0.83 (10.9%)2026.02 | 64.7 | — | — | — | |
| VanillaRetained Tokens=576, Pruning Ratio=100%, Training Protocol=Zero-shot2025.11 | 64.7 | 100 | — | — | |
| YOPOSparsity Op.=true, Sparsity Tok.=false, Vision-side Token=70, Vision-side TFLOPs (Rel.)=0.92 (12.0%)2026.02 | 64.6 | — | — | — | |
| QMoPBackbone=LLaVA-1.5-7B, Vision token count=642026.03 | 64.6 | — | — | — | |
| Pixel-ShuffleBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 64.5 | — | — | — | |
| MQT-LLaVABackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 64.4 | — | — | — | |
| Pixel-ShuffleBackbone=LLaVA-1.5-7B, Vision token count=642026.03 | 64.4 | — | — | — | |
| TokenPackerBackbone=LLaVA-1.5-7B, Vision token count=642026.03 | 64.4 | — | — | — | |
| VisionZip‡Retained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 64.4 | — | — | — | |
| LLaVA-1.5LLM Type=Vicuna-7B2024.03 | 64.3 | — | — | — | |
| VanillaBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 64.3 | — | — | — | |
| FasterVLMBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 64.3 | — | — | — | |
| SparseVLMRetained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 64.3 | — | — | — | |
| ViCASparsity Op.=false, Sparsity Tok.=true, Vision-side Token=24, Vision-side TFLOPs (Rel.)=0.31 (4.1%)2026.02 | 64 | — | — | — | |
| PDropSparsity Op.=false, Sparsity Tok.=true, Vision-side Token=270, Vision-side TFLOPs (Rel.)=3.54 (46.3%)2026.02 | 63.9 | — | — | — | |
| WandaBackbone=LLaVA-NeXT 8B, Sparsity Level=50%, Pruning Method=Wanda, Pruning Type=unstructured, uniform pruning2026.03 | 63.83 | — | — | 88.36 | |
| MQT-LLaVABackbone=LLaVA-1.5-7B, Vision token count=642026.03 | 63.5 | — | — | — | |
| HoloVSparsity Op.=false, Sparsity Tok.=true, Vision-side Token=64, Vision-side TFLOPs (Rel.)=0.83 (10.9%)2026.02 | 63.3 | — | — | — |