Multimodal Evaluation on MMBench
86MMB^CN ScoreDAMO
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DAMOModel=Qwen3-VL-8B, Decoding=DAMO2025.05 | 86 | — | — | — | — | — | — | — | — | 86.43 | — | — | |
| DCLAModel=Qwen3-VL-8B, Decoding=DCLA2025.05 | 85.74 | — | — | — | — | — | — | — | — | 86.51 | — | — | |
| GreedyModel=Qwen3-VL-8B, Decoding=Greedy2025.05 | 85.4 | — | — | — | — | — | — | — | — | 86.51 | — | — | |
| VCDModel=Qwen3-VL-8B, Decoding=VCD2025.05 | 84.97 | — | — | — | — | — | — | — | — | 85.74 | — | — | |
| DCLAModel=Qwen2.5-VL-7B, Decoding=DCLA2025.05 | 83.33 | — | — | — | — | — | — | — | — | 84.71 | — | — | |
| VCDModel=Qwen2.5-VL-7B, Decoding=VCD2025.05 | 83.25 | — | — | — | — | — | — | — | — | 85.22 | — | — | |
| GreedyModel=Qwen2.5-VL-7B, Decoding=Greedy2025.05 | 82.9 | — | — | — | — | — | — | — | — | 84.79 | — | — | |
| DAMOModel=InternVL3-8B, Decoding=DAMO2025.05 | 81.19 | — | — | — | — | — | — | — | — | 66.92 | — | — | |
| DCLAModel=InternVL3-8B, Decoding=DCLA2025.05 | 81.01 | — | — | — | — | — | — | — | — | 67.53 | — | — | |
| GreedyModel=InternVL3-8B, Decoding=Greedy2025.05 | 79.81 | — | — | — | — | — | — | — | — | 66.15 | — | — | |
| DAMOModel=Qwen2.5-VL-7B, Decoding=DAMO2025.05 | 79.21 | — | — | — | — | — | — | — | — | 84.11 | — | — | |
| VCDModel=InternVL3-8B, Decoding=VCD2025.05 | 77.23 | — | — | — | — | — | — | — | — | 64.95 | — | — | |
| Qwen-VL-Max2024.05 | 75.1 | 77.6 | — | — | — | — | — | — | — | — | — | — | |
| GPT4V2024.05 | 74.4 | 77 | — | — | — | — | — | — | — | — | — | — | |
| Gemini 1.5 Pro2024.05 | 74.3 | 73.6 | — | — | — | — | — | — | — | — | — | — | |
| Full FinetuneModel=Llama-3-8B, Sampling Ratio=100%2025.03 | 73.1 | 75.2 | — | — | — | — | — | — | — | — | — | — | |
| PreSelModel=Llama-3-8B, Sampling Ratio=15%2025.03 | 70.6 | 73.3 | — | — | — | — | — | — | — | — | — | — | |
| RandomModel=Llama-3-8B, Sampling Ratio=15%2025.03 | 69.1 | 72.5 | — | — | — | — | — | — | — | — | — | — | |
| CuMoLLM=Mixtral-8×7B, Act.=13.5B2024.05 | 68 | 75.3 | — | — | — | — | — | — | — | — | — | — | |
| CuMoLLM=Mistral-7B, Act.=7.8B2024.05 | 66.6 | 73 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-LLaMA3LLM=LLaMA3-8B-IT, Act.=8.4B2024.05 | 66.4 | 72.3 | — | — | — | — | — | — | — | — | — | — | |
| DragonflyBackbone=Llama3-8B, #Data=2.9M2024.06 | 66.1 | 71.9 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-UHDBackbone=Vicuna-13B, #Data=1.2M2024.06 | 64.8 | 68 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXTLLM=Vicuna-13B, Act.=13.4B2024.05 | 64.4 | 70 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXTBackbone=Vicuna-13B, #Data=1.2M2024.06 | 64.4 | 70 | — | — | — | — | — | — | — | — | — | — | |
| Mipha-3BPT=558K, IT=665K2024.03 | 64.3 | 69.7 | — | — | — | — | — | — | — | — | — | — | |
| VILALLM=Vicuna-13B, Act.=13.4B2024.05 | 64.3 | 70.3 | — | — | — | — | — | — | — | — | — | — | |
| VILABackbone=Llama2-13B, #Data=51M2024.06 | 64.3 | 70.3 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-13BPT=558K, IT=665K2024.03 | 63.6 | 67.7 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-v1.5LLM=Vicuna-13B, Act.=13.4B2024.05 | 63.6 | 67.7 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5Backbone=Vicuna-13B, #Data=1.2M2024.06 | 63.6 | 66.9 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5-13B, Visual Token Retention=576 tokens2026.06 | 63.5 | — | — | — | — | — | — | — | — | 68.5 | — | 100 | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5-13B, Retained Tokens=576 (Upper Bound)2026.06 | 63.5 | — | — | — | — | — | — | — | — | 68.5 | — | — | |
| DARTBackbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 63.3 | — | — | — | — | — | — | — | — | 67.6 | — | 97.1 | |
| SparseVLMBackbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 63.1 | — | — | — | — | — | — | — | — | 68.5 | — | 97.9 | |
| PDropBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 62.8 | — | — | — | — | — | — | — | — | 67.5 | — | — | |
| SparseVLMBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 62.6 | — | — | — | — | — | — | — | — | 68.4 | — | — | |
| VisionZipBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 62.5 | — | — | — | — | — | — | — | — | 67.4 | — | — | |
| FastVBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 62.3 | — | — | — | — | — | — | — | — | 66.1 | — | — | |
| DARTBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 62.2 | — | — | — | — | — | — | — | — | 65.4 | — | — | |
| VisPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 62.2 | — | — | — | — | — | — | — | — | 67.2 | — | — | |
| SPAREBackbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 62.1 | — | — | — | — | — | — | — | — | 66.9 | — | 98 | |
| InternVL-13BBackbone=Vicuna-13B, #Data=6B2024.06 | 61.9 | 66.5 | — | — | — | — | — | — | — | — | — | — | |
| AgilePruneBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 61.9 | — | — | — | — | — | — | — | — | 67.6 | — | — | |
| AVG-LLaVAResolution=High, LLM=Vicuna-7B2024.09 | 61.8 | 69.9 | — | — | — | — | — | — | — | — | — | — | |
| VILALLM=Vicuna-7B, Act.=7.1B2024.05 | 61.7 | 68.9 | — | — | — | — | — | — | — | — | — | — | |
| ERABackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 61.7 | — | — | — | — | — | — | — | — | 67.1 | — | — | |
| AgilePruneBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 61.6 | — | — | — | — | — | — | — | — | 66.2 | — | — | |
| CDPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 61.5 | — | — | — | — | — | — | — | — | 67.5 | — | — | |
| CDPrunerBackbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 61.4 | — | — | — | — | — | — | — | — | 67.5 | — | 97.9 | |
| VisionZipBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 61.3 | — | — | — | — | — | — | — | — | 64.9 | — | — | |
| LLaVA-NeXTLLM=Mistral-7B, Act.=7.6B2024.05 | 61.2 | 68.7 | — | — | — | — | — | — | — | — | — | — | |
| PruMerge+Backbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 61.2 | — | — | — | — | — | — | — | — | 66.3 | — | — | |
| DARTBackbone=LLaVA-1.5-13B, Visual Token Retention=64 tokens2026.06 | 61 | — | — | — | — | — | — | — | — | 65.5 | — | 92.5 | |
| PreSelModel=Vicuna-13B, Sampling Ratio=15%2025.03 | 60.9 | 66.4 | — | — | — | — | — | — | — | — | — | — | |
| ZOO-PruneBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 60.9 | — | — | — | — | — | — | — | — | 67 | — | — | |
| Full FinetuneModel=Vicuna-13B, Sampling Ratio=100%2025.03 | 60.7 | 68.2 | — | — | — | — | — | — | — | — | — | — | |
| DivPruneBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 60.7 | — | — | — | — | — | — | — | — | 66.3 | — | — | |
| ERABackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 60.7 | — | — | — | — | — | — | — | — | 66.1 | — | — | |
| LLaVA-NeXTResolution=High, LLM=Vicuna-7B2024.09 | 60.6 | 67.4 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXTLLM=Vicuna-7B, Act.=7.1B2024.05 | 60.6 | 67.4 | — | — | — | — | — | — | — | — | — | — | |
| DARTBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 60.6 | — | — | — | — | — | — | — | — | 64.7 | — | — | |
| SparseVLMBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 60.3 | — | — | — | — | — | — | — | — | 65.2 | — | — | |
| PruMerge+Backbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 60.2 | — | — | — | — | — | — | — | — | 64.9 | — | 93.2 | |
| SPAREBackbone=LLaVA-1.5-13B, Visual Token Retention=64 tokens2026.06 | 60.1 | — | — | — | — | — | — | — | — | 66.2 | — | 97.2 | |
| ZOO-PruneBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 60.1 | — | — | — | — | — | — | — | — | 64.8 | — | — | |
| VisPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 59.9 | — | — | — | — | — | — | — | — | 65 | — | — | |
| DivPruneBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 59.8 | — | — | — | — | — | — | — | — | 64.1 | — | — | |
| PruMerge+Backbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 59.3 | — | — | — | — | — | — | — | — | 65 | — | — | |
| Claude 3 Opus2024.05 | 59.2 | 63.3 | — | — | — | — | — | — | — | — | — | — | |
| PruMerge+Backbone=LLaVA-1.5-13B, Visual Token Retention=64 tokens2026.06 | 58.9 | — | — | — | — | — | — | — | — | 63.9 | — | 90 | |
| CDPrunerBackbone=LLaVA-1.5-13B, Visual Token Retention=64 tokens2026.06 | 58.9 | — | — | — | — | — | — | — | — | 65.5 | — | 96.3 | |
| CDPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 58.8 | — | — | — | — | — | — | — | — | 65.5 | — | — | |
| SparseVLMBackbone=LLaVA-1.5-13B, Visual Token Retention=64 tokens2026.06 | 58.6 | — | — | — | — | — | — | — | — | 63 | — | 89.7 | |
| TRIMBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 58.4 | — | — | — | — | — | — | — | — | 67.1 | — | — | |
| LLaVA-1.5Resolution=Standard, LLM=Vicuna-7B2024.09 | 58.3 | 64.3 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-7BPT=558K, IT=665K2024.03 | 58.3 | 64.3 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-v1.5LLM=Vicuna-7B, Act.=7.1B2024.05 | 58.3 | 64.3 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5LLM=Vicuna-7B2024.05 | 58.3 | 64.3 | — | — | — | — | — | — | — | — | — | — | |
| Full-DataSampling Ratio=100% (665K), Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 58.3 | — | — | — | — | — | — | — | — | 64.3 | — | — | |
| LLaVA-1.5-7BRetained Tokens=All 576, Reduction Ratio=100%2026.02 | 58.1 | — | — | — | — | — | — | — | — | 64.6 | 100 | — | |
| LOVA³-7BLLM=Vicuna-7B2024.05 | 57.6 | 66.5 | — | — | — | — | — | — | — | — | — | — | |
| DARTRetained Tokens=128, Reduction Ratio=77.8%2026.02 | 57.3 | — | — | — | — | — | — | — | — | 60.7 | 95.2 | — | |
| TypiClustSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 57.1 | — | — | — | — | — | — | — | — | 64.3 | — | — | |
| FastVRetained Tokens=192, Reduction Ratio=66.7%2026.02 | 57 | — | — | — | — | — | — | — | — | 61.2 | 88 | — | |
| DARTRetained Tokens=192, Reduction Ratio=66.7%2026.02 | 57 | — | — | — | — | — | — | — | — | 63.6 | 97.8 | — | |
| VisPrunerRetained Tokens=192, Reduction Ratio=66.7%2026.02 | 57 | — | — | — | — | — | — | — | — | 63.1 | 98.2 | — | |
| VisionZipRetained Tokens=128, Reduction Ratio=77.8%2026.02 | 57 | — | — | — | — | — | — | — | — | 62.1 | 96.2 | — | |
| DARTBackbone=LLaVA-1.5-13B, Visual Token Retention=32 tokens2026.06 | 57 | — | — | — | — | — | — | — | — | 61.9 | — | 86 | |
| SparseVLMRetained Tokens=128, Reduction Ratio=77.8%2026.02 | 56.9 | — | — | — | — | — | — | — | — | 62.6 | 95.6 | — | |
| HoloVRetained Tokens=128, Reduction Ratio=77.8%2026.02 | 56.8 | — | — | — | — | — | — | — | — | 62.4 | 96.1 | — | |
| Qwen-VL-ChatPT=1.4B†, IT=50M†2024.03 | 56.7 | 60.6 | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-ChatLLM=Qwen-7B2024.05 | 56.7 | 60.6 | — | — | — | — | — | — | — | — | — | — | |
| CDPrunerBackbone=LLaVA-1.5-13B, Visual Token Retention=32 tokens2026.06 | 56.6 | — | — | — | — | — | — | — | — | 63.7 | — | 92.6 | |
| PDropBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 56.6 | — | — | — | — | — | — | — | — | 63.1 | — | — | |
| FSRRetained Tokens=192, Reduction Ratio=66.7%2026.02 | 56.5 | — | — | — | — | — | — | — | — | 64 | 99.1 | — | |
| VisPrunerRetained Tokens=128, Reduction Ratio=77.8%2026.02 | 56.5 | — | — | — | — | — | — | — | — | 61.8 | 96.7 | — | |
| PreSelSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 56.5 | — | — | — | — | — | — | — | — | 64.8 | — | — | |
| SPAREBackbone=LLaVA-1.5-13B, Visual Token Retention=32 tokens2026.06 | 56.5 | — | — | — | — | — | — | — | — | 63.7 | — | 94.7 | |
| OFASampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 56.3 | — | — | — | — | — | — | — | — | 63.5 | — | — |