Multimodal Benchmark on MMBench (MMB)
81.8AccuracyInternVL2-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL2-8BModel=InternVL2-8B, Pruning Method=None2025.09 | 81.8 | |
| PTPModel=InternVL2-8B, Pruning Method=PTP, Pruning Ratio (r)=0.5, Balancing Weight (alpha)=0.52025.09 | 81.5 | |
| CogVLM-17BPT tks.=256, Parm.=10B, Training set observed=false2024.07 | 77.6 | |
| Honeybee-13BPT tks.=256, Parm.=13B, Training set observed=false2024.07 | 73.2 | |
| CoS-7BPT tks.=80, Parm.=532M, Training set observed=false2024.07 | 72.8 | |
| PTPModel=InternVL2-2B, Pruning Method=PTP, Pruning Ratio (r)=0.5, Balancing Weight (alpha)=0.52025.09 | 72.8 | |
| InternVL2-2BModel=InternVL2-2B, Pruning Method=None2025.09 | 72.5 | |
| OlympusLM=Phi-2-2.7B, Res.=3842024.12 | 71.2 | |
| VILA-13BPT tks.=576, Parm.=13B, Training set observed=false2024.07 | 70.3 | |
| HiPruneBackbone=LLaVA-NeXT-13B, Token Num=6402025.08 | 70.2 | |
| Honeybee-7BPT tks.=144, Parm.=7B, Training set observed=false2024.07 | 70.1 | |
| HiPrune++Backbone=LLaVA-NeXT-13B, Token Num=6402025.08 | 69.9 | |
| Mipha-3BLM=Phi-2-2.7B, Res.=3842024.12 | 69.7 | |
| Mini-Gemini-7BPT tks.=576, Parm.=7B, Training set observed=false2024.07 | 69.3 | |
| VILA-7BPT tks.=576, Parm.=7B, Training set observed=false2024.07 | 68.9 | |
| HiPrune++Backbone=LLaVA-NeXT-13B, Token Num=3202025.08 | 68.8 | |
| Bunny-3BLM=Phi-2-2.7B, Res.=3842024.12 | 68.6 | |
| HiPruneBackbone=LLaVA-NeXT-13B, Token Num=3202025.08 | 68.6 | |
| Mini-Gemini-13BPT tks.=576, Parm.=13B, Training set observed=false2024.07 | 68.5 | |
| LLaVA-NeXT-13BToken Num=28802025.08 | 68.5 | |
| VanillaBase Model=LLaVA-1.5-13B, Retain Tokens=576, Retention Ratio=100%2026.06 | 68.5 | |
| ASAPFLOPs=1.253, Ratio=31.88, Retained Tokens=1922026.03 | 68.29 | |
| MoE-LLaVA-3.6BLM=Phi-2-2.7B, Res.=3842024.12 | 68 | |
| LLaVA-NeXT-7BRetained Tokens=28802025.09 | 67.9 | |
| LLaVA-1.5-13BFLOPs=3.817, Ratio=100%, Retained Tokens=Vanilla2026.03 | 67.71 | |
| LLaVA-1.5-13BPT tks.=576, Parm.=13B, Training set observed=false2024.07 | 67.7 | |
| LLaVA-1.5-13BToken Num=5762025.08 | 67.7 | |
| SparseVLMFLOPs=1.253, Ratio=32.83, Retained Tokens=1922026.03 | 67.61 | |
| PDropBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 67.5 | |
| SparseVLMBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 67.4 | |
| CLSEBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 67.4 | |
| HiPrune++Backbone=LLaVA-1.5-13B, Token Num=1282025.08 | 67.2 | |
| HiPruneBackbone=LLaVA-1.5-13B, Token Num=1922025.08 | 67.1 | |
| TinyLLaVALM=Phi-2-2.7B, Res.=3842024.12 | 66.9 | |
| HiPruneBackbone=LLaVA-1.5-13B, Token Num=1282025.08 | 66.8 | |
| Imp-v1LM=Phi-2-2.7B, Res.=3842024.12 | 66.5 | |
| HiPrune++Backbone=LLaVA-1.5-13B, Token Num=1922025.08 | 66.5 | |
| CLSEBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 66.5 | |
| FastVFLOPs=1.259, Ratio=32.99, Retained Tokens=1922026.03 | 66.43 | |
| PruMerge+FLOPs=1.253, Ratio=32.83, Retained Tokens=1922026.03 | 66.32 | |
| VisionZipRetained Tokens=6402025.09 | 66.3 | |
| HiPruneBackbone=LLaVA-NeXT-13B, Token Num=1602025.08 | 66.3 | |
| HiPrune++Backbone=LLaVA-NeXT-13B, Token Num=1602025.08 | 66.3 | |
| ASAPFLOPs=0.797, Ratio=20.901, Retained Tokens=1282026.03 | 66.18 | |
| SparseVLMFLOPs=0.833, Ratio=21.801, Retained Tokens=1282026.03 | 66.09 | |
| DualSpeedInference Mode=Normal, Pruning Rate (p)=0%, Mode Isolator Employment=No2026.02 | 65.98 | |
| DivpruneFLOPs=1.253, Ratio=32.83, Retained Tokens=1922026.03 | 65.95 | |
| DivpruneFLOPs=0.833, Ratio=21.801, Retained Tokens=1282026.03 | 65.81 | |
| SparseVLMBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 65.8 | |
| SparseVLMRetained Tokens=6402025.09 | 65.7 | |
| DualSpeedInference Mode=Pruning, Pruning Rate (p)=90%, Mode Isolator Employment=No2026.02 | 65.38 | |
| DivPruneRetained Tokens=6402025.09 | 65.38 | |
| LLaVA-1.5Inference Mode=Normal, Pruning Rate (p)=0%, Mode Isolator Employment=No2026.02 | 65.21 | |
| ZOO-PruneRetained Tokens=6402025.09 | 65.21 | |
| FiCoCo-VBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 65.2 | |
| NaivePruneInference Mode=Pruning, Pruning Rate (p)=90%, Mode Isolator Employment=No2026.02 | 65.03 | |
| DualSpeedInference Mode=Pruning, Pruning Rate (p)=90%, Mode Isolator Employment=Yes2026.02 | 65.03 | |
| HiPrune++Backbone=LLaVA-1.5-13B, Token Num=642025.08 | 65 | |
| PDropBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 65 | |
| ZOO-PruneRetained Tokens=3202025.09 | 64.86 | |
| HiPruneBackbone=LLaVA-1.5-13B, Token Num=642025.08 | 64.8 | |
| PruMerge+FLOPs=0.833, Ratio=21.801, Retained Tokens=1282026.03 | 64.63 | |
| mPLUG-Owl2PT tks.=64, Parm.=7B, Training set observed=false2024.07 | 64.5 | |
| mPLUG-Owl2LM=LLaMA-7B, Res.=4482024.12 | 64.5 | |
| LLaVA-1.5-7BPT tks.=576, Parm.=7B, Training set observed=false2024.07 | 64.3 | |
| LLaVA-1.5LM=Vicuna-7B, Res.=3362024.12 | 64.3 | |
| SparseVLMRetained Tokens=3202025.09 | 64.3 | |
| ViTCoPRetained Tokens=1922026.01 | 64.26 | |
| ZOO-PruneRetained Tokens=1602025.09 | 64.18 | |
| FastVFLOPs=0.836, Ratio=21.898, Retained Tokens=1282026.03 | 64.15 | |
| Vanilla (LLaVA-1.5-7B)Retained Tokens=5762026.01 | 64.08 | |
| ViTCoPRetained Tokens=1282026.01 | 63.83 | |
| PyramidDropRetained Tokens=1922026.01 | 63.75 | |
| VisionZipRetained Tokens=1922026.01 | 63.66 | |
| DivPruneRetained Tokens=3202025.09 | 63.66 | |
| CLSEBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 63.3 | |
| MobileVLM-v2-3BLM=MobileLLaMA-2.7B, Res.=3362024.12 | 63.2 | |
| VisionZipRetained Tokens=3202025.09 | 63.1 | |
| SparseVLMRetained Tokens=1602025.09 | 63.1 | |
| NaivePruneInference Mode=Normal, Pruning Rate (p)=0%, Mode Isolator Employment=No2026.02 | 63.06 | |
| ViTCoPRetained Tokens=642026.01 | 63.06 | |
| SparseVLMRetained Tokens=1922026.01 | 62.92 | |
| VisionZipRetained Tokens=1282026.01 | 62.37 | |
| DivPruneRetained Tokens=1602025.09 | 62.29 | |
| FiCoCo-VBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 62.1 | |
| LLaVA-1.5Inference Mode=Pruning, Pruning Rate (p)=90%, Mode Isolator Employment=No2026.02 | 61.51 | |
| SparseVLMBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 61.3 | |
| SparseVLMRetained Tokens=1282026.01 | 60.71 | |
| Qwen-VL-ChatLM=Qwen-7B, Res.=4482024.12 | 60.6 | |
| FastVRetained Tokens=1922026.01 | 60.57 | |
| VisionZipRetained Tokens=642026.01 | 60.31 | |
| VisionZipRetained Tokens=1602025.09 | 60.1 | |
| PyramidDropRetained Tokens=1282026.01 | 59.89 | |
| LLaVA-PhiLM=Phi-2-2.7B, Res.=3362024.12 | 59.8 | |
| MobileVLM-3BLM=MobileLLaMA-2.7B, Res.=3362024.12 | 59.6 | |
| PDropBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 59.2 | |
| ShikraParm.=7B, Training set observed=false2024.07 | 58.8 | |
| ShikraLM=Vicuna-13B, Res.=2242024.12 | 58.8 | |
| SparseVLMRetained Tokens=642026.01 | 57.9 | |
| FastVBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 57.9 |