Multi-modal Evaluation on MME (Score Metric)
2,389.7MME ScoreInternVL3-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL3-8BBackbone=InternVL3-8B, Retained Tokens=1280, Reduction Ratio=0%2026.06 | 2,389.7 | |
| Qwen3-VL-4BModel=Qwen3-VL, Parameter Count=4B2026.04 | 2,371.74 | |
| VanillaBackbone=Qwen2-VL-7B, Flops Ratio Reduction=0%2026.04 | 2,307 | |
| VanillaToken Reduction=0% (Upper Bound)2026.04 | 2,306 | |
| DARTBackbone=InternVL3-8B, Retained Tokens=256, Reduction Ratio=80.0%2026.06 | 2,280.4 | |
| ERABackbone=InternVL3-8B, Retained Tokens=256, Reduction Ratio=80.0%2026.06 | 2,251.7 | |
| VisionZipBackbone=InternVL3-8B, Retained Tokens=256, Reduction Ratio=80.0%2026.06 | 2,192 | |
| DivPruneBackbone=InternVL3-8B, Retained Tokens=256, Reduction Ratio=80.0%2026.06 | 2,188.7 | |
| DARTBackbone=InternVL3-8B, Retained Tokens=128, Reduction Ratio=90.0%2026.06 | 2,180.4 | |
| Qwen2.5-VL-3BModel=Qwen2.5-VL, Parameter Count=3B2026.04 | 2,144.75 | |
| InfiniteVL-4BModel=InfiniteVL, Parameter Count=4B, Result Source=InfiniteVL (Tao et al., 2025) paper2026.04 | 2,126 | |
| HalfVBackbone=Qwen2-VL-7B, Flops Ratio Reduction=88.9%2026.04 | 2,124 | |
| ERABackbone=InternVL3-8B, Retained Tokens=128, Reduction Ratio=90.0%2026.06 | 2,119.2 | |
| DASHToken Reduction=75.00%2026.04 | 2,109 | |
| LLaVA-OV-Pt + IRABackbone=LLaVA-OV, Training stage=IRA2026.07 | 2,109 | |
| FastVToken Reduction=75.00%2026.04 | 2,101 | |
| Qwen3VL-2B-SFTTokens=-2026.05 | 2,087.55 | |
| DARTBackbone=Qwen2-VL-7B, Flops Ratio Reduction=88.9%2026.04 | 2,086 | |
| InternVL2-4BModel=InternVL2, Parameter Count=4B, Result Source=OpenVLM Leaderboard (OpenCompass, 2025)2026.04 | 2,064.6 | |
| VisionZipToken Reduction=75.00%2026.04 | 2,058 | |
| DARTToken Reduction=75.00%2026.04 | 2,056 | |
| PruMerge+Token Reduction=75.00%2026.04 | 2,044 | |
| DivPruneBackbone=InternVL3-8B, Retained Tokens=128, Reduction Ratio=90.0%2026.06 | 2,043 | |
| InternVL2.5-Pt + IRABackbone=InternVL2.5, Training stage=IRA2026.07 | 2,038 | |
| LLaVA-OV-Pt + SFTBackbone=LLaVA-OV, Training stage=SFT2026.07 | 2,030 | |
| HoloVBackbone=Qwen2-VL-7B, Flops Ratio Reduction=88.9%2026.04 | 2,006 | |
| VisionZipBackbone=InternVL3-8B, Retained Tokens=128, Reduction Ratio=90.0%2026.06 | 1,987.8 | |
| LLaVA-OneVision-7BModel=LLaVA-OneVision, Parameter Count=7B2026.04 | 1,987.63 | |
| SpB2.0-VL-5BModel=SpB2.0-VL, Parameter Count=5B2026.04 | 1,981.99 | |
| InternVL2.5-Pt + SFTBackbone=InternVL2.5, Training stage=SFT2026.07 | 1,981 | |
| InternVL2-Pt + IRABackbone=InternVL2, Training stage=IRA2026.07 | 1,959 | |
| FastVBackbone=Qwen2-VL-7B, Flops Ratio Reduction=88.9%2026.04 | 1,940 | |
| DASHToken Reduction=88.89%2026.04 | 1,928 | |
| DARTToken Reduction=88.89%2026.04 | 1,903 | |
| DASHToken Reduction=93.75%2026.04 | 1,901 | |
| EVIANData Selection Strategy=10K subset2026.04 | 1,876.89 | |
| FastVToken Reduction=88.89%2026.04 | 1,866 | |
| VanillaBackbone=LLaVA-1.5-7B, Token Reduction Rate=0.0%2025.05 | 1,862 | |
| VanillaLoc.=-, Retained Tokens=576, Pruning Ratio=0%2026.03 | 1,862 | |
| MoB (+ η-prior)Backbone=LLaVA-1.5-7B, Objectives=-, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 1,860 | |
| MoB (w/o η-prior)Backbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 1,858 | |
| DARTBackbone=LLaVA-1.5-7B, Objectives=VP, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 1,856 | |
| DARTLoc.=L2, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 1,856 | |
| VanillaBackbone=LLaVA-NeXT-7B, Token Retention=2880, Reduction Ratio=100%2026.02 | 1,851 | |
| VanillaBackbone=LLaVA-Next-7B, Token Reduction Rate=0.0%2025.05 | 1,851 | |
| LLaVA-NeXT-7BBase Model=LLaVA-NeXT-7B, Retained Tokens=2880, Pruning Ratio=100%2026.04 | 1,851 | |
| MoB (+ η-prior)Backbone=LLaVA-1.5-7B, Objectives=-, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 1,845 | |
| MoB (w/o η-prior)Backbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 1,842 | |
| ETCTokens=42026.05 | 1,840.46 | |
| ETCTokens=22026.05 | 1,840.24 | |
| DARTBackbone=LLaVA-1.5-7B, Objectives=VP, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 1,840 | |
| DARTLoc.=L2, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 1,840 | |
| PriorTRBackbone=LLaVA-1.5-13B, Retained Tokens=1922026.06 | 1,839 | |
| ETCTokens=12026.05 | 1,838.02 | |
| PriorTRBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 1,823 | |
| HoloVLoc.=Pre, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 1,820 | |
| VisionZipToken Reduction=88.89%2026.04 | 1,819 | |
| VanillaBase Model=LLaVA 1.5 13B, Tokens Retained=576, Projector Fine-tuning=false2024.12 | 1,818 | |
| VanillaBackbone=LLaVA-1.5-13B, Retained Tokens=5762026.06 | 1,816 | |
| ApETBackbone=LLaVA-NeXT-7B, Token Retention=640, Reduction Ratio=77.8%2026.02 | 1,815 | |
| SCALEData Selection Strategy=10K subset2026.04 | 1,814.97 | |
| BLIP-2Data Selection Strategy=10K subset2026.04 | 1,810.34 | |
| MoB (w/o η-prior)Backbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=64, Token Reduction Rate=88.9%2025.05 | 1,806 | |
| MoB (+ η-prior)Backbone=LLaVA-1.5-7B, Objectives=-, Pruning budget K=64, Token Reduction Rate=88.9%2025.05 | 1,806 | |
| HoloVLoc.=Pre, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 1,802 | |
| PDropLoc.=L8–L24, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 1,797 | |
| PruMerge+Token Reduction=88.89%2026.04 | 1,794 | |
| InternVL2-Pt + SFTBackbone=InternVL2, Training stage=SFT2026.07 | 1,792 | |
| PRUNESIDLoc.=Pre, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 1,791 | |
| AutoSelectLoc.=Pre, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 1,791 | |
| FlowCutBase Model=LLaVA-NeXT-7B, Retained Tokens=320, Pruning Ratio=88.9%2026.04 | 1,791 | |
| VisionZip ‡Base Model=LLaVA 1.5 13B, Tokens Retained=192, Projector Fine-tuning=true2024.12 | 1,790 | |
| VisionZipBackbone=LLaVA-NeXT-7B, Token Retention=640, Reduction Ratio=77.8%2026.02 | 1,787 | |
| MustDropBackbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 1,787 | |
| PDropBackbone=LLaVA-1.5-13B, Retained Tokens=1922026.06 | 1,786 | |
| ApETBackbone=LLaVA-NeXT-7B, Token Retention=320, Reduction Ratio=88.9%2026.02 | 1,783 | |
| VisionZipLoc.=Pre, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 1,783 | |
| PDropBackbone=LLaVA-NeXT-7B, Token Retention=640, Reduction Ratio=77.8%2026.02 | 1,781 | |
| DeSAPBase Model=LLaVA-NeXT-7B, Retained Tokens=320, Pruning Ratio=88.9%2026.04 | 1,781 | |
| DARTToken Reduction=93.75%2026.04 | 1,774 | |
| SparseVLMBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 1,774 | |
| SparseVLMBackbone=LLaVA-NeXT-7B, Token Retention=640, Reduction Ratio=77.8%2026.02 | 1,773 | |
| MaTVLM-3BModel=MaTVLM, Parameter Count=3B, Result Source=InfiniteVL (Tao et al., 2025) paper2026.04 | 1,771 | |
| SmolVLM2-2.2BModel=SmolVLM2, Parameter Count=2.2B2026.04 | 1,770.07 | |
| SparseVLMBackbone=LLaVA-1.5-13B, Retained Tokens=1922026.06 | 1,768 | |
| DARTBackbone=LLaVA-1.5-7B, Objectives=VP, Pruning budget K=64, Token Reduction Rate=88.9%2025.05 | 1,765 | |
| AutoSelectLoc.=Pre, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 1,765 | |
| DARTLoc.=L2, Retained Tokens=64, Pruning Ratio=88.9%2026.03 | 1,765 | |
| VisionZipLoc.=Pre, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 1,762 | |
| PDropLoc.=L8–L24, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 1,761 | |
| PriorTRBackbone=LLaVA-1.5-13B, Retained Tokens=642026.06 | 1,761 | |
| MoB (with η-prior)Backbone=LLaVA-Next-7B, Objectives=PA VP, Pruning budget K=320, Token Reduction Rate=88.9%2025.05 | 1,760 | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=192, Projector Fine-tuning=false2024.12 | 1,754 | |
| DivPruneLoc.=Pre, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 1,752 | |
| DivPruneLoc.=Pre, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 1,752 | |
| VisPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=1922026.06 | 1,751 | |
| PRUNESIDLoc.=Pre, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 1,749 | |
| MustDropBackbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 1,745 | |
| PDropBackbone=LLaVA-1.5-13B, Retained Tokens=1282026.06 | 1,744 | |
| VisionZipBase Model=LLaVA 1.5 13B, Tokens Retained=128, Projector Fine-tuning=false2024.12 | 1,743 |