Multimodal Model Evaluation on MME
2,005Total ScoreInternVL2.5
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| InternVL2.5# train tokens=0.5T, Architecture Category=Token Insertion – Proprietary2025.12 | 2,005 | — | — | — | — | — | |
| mPLUG-Owl3 8B# train tokens=0.1T, Architecture Category=Cross-attention-based – Public data, LLM Size=8B2025.12 | 1,940 | — | — | — | — | — | |
| VideoLLaMA3Architecture Category=Token Insertion – Proprietary2025.12 | 1,901 | — | — | — | — | — | |
| LLaVA-NeXT-7BRetained Tokens=2880, Reduction Ratio=100%2026.02 | 1,883 | — | — | — | — | — | |
| Qwen2-VL# train tokens=1.4T, Architecture Category=Token Insertion – Proprietary2025.12 | 1,872 | — | — | — | — | — | |
| LLaVA1.5-7B2026.01 | 1,862.7 | — | — | — | — | — | |
| LLaVA-1.5-7BVisual Token Budget=Total 576 Tokens2026.02 | 1,862 | — | — | — | — | — | |
| CARPE-MoE2026.01 | 1,861.7 | — | — | — | — | — | |
| VisionZipVisual Token Budget=Avg 192 Tokens2026.02 | 1,834 | — | — | — | — | — | |
| FSRRetained Tokens=640, Reduction Ratio=↓ 77.8%2026.02 | 1,833 | — | — | — | — | — | |
| VisPrunerRetained Tokens=640, Reduction Ratio=↓ 77.8%2026.02 | 1,828 | — | — | — | — | — | |
| CARPE2026.01 | 1,826.5 | — | — | — | — | — | |
| DUET-VLM (C)Visual Token Budget=Avg 192 Tokens2026.02 | 1,826 | — | — | — | — | — | |
| DUET-VLM (C+S)Visual Token Budget=Avg 192 Tokens2026.02 | 1,820 | — | — | — | — | — | |
| DUET-VLM (C)Visual Token Budget=Avg 128 Tokens2026.02 | 1,817 | — | — | — | — | — | |
| DUET-VLM (C+S)Visual Token Budget=Avg 128 Tokens2026.02 | 1,815 | — | — | — | — | — | |
| VisPrunerRetained Tokens=960, Reduction Ratio=↓ 66.7%2026.02 | 1,807 | — | — | — | — | — | |
| FSRRetained Tokens=960, Reduction Ratio=↓ 66.7%2026.02 | 1,806 | — | — | — | — | — | |
| WiSE-FT2026.01 | 1,803.5 | — | — | — | — | — | |
| CDPrunerRetained Tokens=640, Reduction Ratio=↓ 77.8%2026.02 | 1,800 | — | — | — | — | — | |
| CDPrunerRetained Tokens=960, Reduction Ratio=↓ 66.7%2026.02 | 1,799 | — | — | — | — | — | |
| SPHINX-13B2026.01 | 1,798.3 | — | — | — | — | — | |
| DUET-VLM (C+all)Visual Token Budget=Avg 192 Tokens2026.02 | 1,790 | — | — | — | — | — | |
| FSRRetained Tokens=320, Reduction Ratio=↓ 88.9%2026.02 | 1,783 | — | — | — | — | — | |
| CDPrunerRetained Tokens=320, Reduction Ratio=↓ 88.9%2026.02 | 1,773 | — | — | — | — | — | |
| HoloVRetained Tokens=640, Reduction Ratio=↓ 77.8%2026.02 | 1,768 | — | — | — | — | — | |
| DUET-VLM (C+all)Visual Token Budget=Avg 128 Tokens2026.02 | 1,760 | — | — | — | — | — | |
| VisionZipVisual Token Budget=Avg 64 Tokens2026.02 | 1,756 | — | — | — | — | — | |
| DUET-VLM (C+S)Visual Token Budget=Avg 64 Tokens2026.02 | 1,754 | — | — | — | — | — | |
| HoloVRetained Tokens=320, Reduction Ratio=↓ 88.9%2026.02 | 1,753 | — | — | — | — | — | |
| VisPrunerRetained Tokens=320, Reduction Ratio=↓ 88.9%2026.02 | 1,753 | — | — | — | — | — | |
| LEVI2026.01 | 1,752.1 | — | — | — | — | — | |
| VisionZipVisual Token Budget=Avg 128 Tokens2026.02 | 1,748 | — | — | — | — | — | |
| LLaVA1.5-7BFine-tuned=ImageNet2026.01 | 1,744.2 | — | — | — | — | — | |
| DUET-VLM (C)Visual Token Budget=Avg 64 Tokens2026.02 | 1,737 | — | — | — | — | — | |
| DUET-VLM (C+all)Visual Token Budget=Avg 64 Tokens2026.02 | 1,736 | — | — | — | — | — | |
| DivPruneRetained Tokens=640, Reduction Ratio=↓ 77.8%2026.02 | 1,734 | — | — | — | — | — | |
| InsertionHe-2B# train tokens=0.1T, Architecture Category=Token Insertion – Public data, LLM Size=2B2025.12 | 1,732 | — | — | — | — | — | |
| HoloVRetained Tokens=960, Reduction Ratio=↓ 66.7%2026.02 | 1,713 | — | — | — | — | — | |
| DivPruneRetained Tokens=320, Reduction Ratio=↓ 88.9%2026.02 | 1,687 | — | — | — | — | — | |
| FastVRetained Tokens=640, Reduction Ratio=↓ 77.8%2026.02 | 1,667 | — | — | — | — | — | |
| CASA⊕# train tokens=0.3T, Architecture=CASAHe-2B, CASA design variant=⊕, LLM Size=2B2025.12 | 1,620 | — | — | — | — | — | |
| CASA∨# train tokens=0.3T, Architecture=CASAHe-2B, CASA design variant=∨, LLM Size=2B2025.12 | 1,574 | — | — | — | — | — | |
| CASA→# train tokens=0.3T, Architecture=CASAHe-2B, CASA design variant=→, LLM Size=2B2025.12 | 1,572 | — | — | — | — | — | |
| SmolVLMArchitecture Category=Token Insertion – Public data, LLM Size=2B2025.12 | 1,568 | — | — | — | — | — | |
| mPLUG-Owl3 2B# train tokens=0.1T, Architecture Category=Cross-attention-based – Public data, LLM Size=2B2025.12 | 1,551 | — | — | — | — | — | |
| LLaVA-1.5LLM=LLaMA-13B [59], Model Type=Dense Model2025.07 | 1,531.3 | — | — | — | — | — | |
| StreamChat 7BArchitecture Category=Cross-attention-based – Public data, LLM Size=7B2025.12 | 1,520 | — | — | — | — | — | |
| LLaVA-1.5LLM=Vicuna-7B [60], Model Type=Dense Model2025.07 | 1,510.7 | — | — | — | — | — | |
| Our MethodLLM=Phi2-2.7B [62], Model Type=Sparse Model, Expert Selection (Top-k)=Top42025.07 | 1,446.5 | — | — | — | — | — | |
| MoE-LLaVA-4Top2LLM=Phi2-2.7B [62], Model Type=Sparse Model, Expert Selection (Top-k)=4Top22025.07 | 1,423 | — | — | — | — | — | |
| Our MethodLLM=StableLM-1.6B [65], Model Type=Sparse Model, Expert Selection (Top-k)=Top42025.07 | 1,363.5 | — | — | — | — | — | |
| LLaVA-PhiLLM=Phi2-2.7B [62], Model Type=Dense Model2025.07 | 1,335.1 | — | — | — | — | — | |
| MoE-LLaVA-4Top2LLM=StableLM-1.6B [65], Model Type=Sparse Model, Expert Selection (Top-k)=4Top22025.07 | 1,318.2 | — | — | — | — | — | |
| FastVRetained Tokens=320, Reduction Ratio=↓ 88.9%2026.02 | 1,302 | — | — | — | — | — | |
| MobileVLMLLM=MobileLLaMA-2.7B [63], Model Type=Dense Model2025.07 | 1,288.9 | — | — | — | — | — | |
| MoDModel=LLaVA-NEXT2025.05 | 653.3 | 195 | 160 | 133.3 | 165 | — | |
| MoDModel=LLaVA-v1.52025.05 | 638.3 | 195 | 141.7 | 126.7 | 175 | — | |
| MoDModel=Qwen-VL2025.05 | 613.3 | 170 | 160 | 103.3 | 180 | — | |
| AvisCModel=LLaVA-NEXT2025.05 | 613.3 | 195 | 160 | 108.3 | 150 | — | |
| VCDModel=LLaVA-NEXT2025.05 | 611.7 | 190 | 145 | 116.7 | 160 | — | |
| M3IDModel=LLaVA-NEXT2025.05 | 608.3 | 195 | 145 | 103.3 | 165 | — | |
| AvisCModel=LLaVA-v1.52025.05 | 596.7 | 195 | 116.7 | 131.7 | 153.3 | — | |
| samplingModel=LLaVA-NEXT2025.05 | 595 | 175 | 143.3 | 131.7 | 145 | — | |
| VCDModel=Qwen-VL2025.05 | 593.3 | 165 | 140 | 113.3 | 175 | — | |
| M3IDModel=Qwen-VL2025.05 | 586.7 | 165 | 143.3 | 103.3 | 175 | — | |
| samplingModel=Qwen-VL2025.05 | 581.7 | 160 | 143.3 | 113.3 | 165 | — | |
| AvisCModel=Qwen-VL2025.05 | 578.3 | 160 | 145 | 113.3 | 160 | — | |
| M3IDModel=LLaVA-v1.52025.05 | 553.3 | 185 | 118.3 | 121.7 | 128.3 | — | |
| VCDModel=LLaVA-v1.52025.05 | 531.7 | 180 | 110 | 108.3 | 133.3 | — | |
| samplingModel=LLaVA-v1.52025.05 | 510 | 170 | 103.3 | 108.3 | 128.3 | — | |
| AsymVLMKeep ratio=75%, FLOPs Saved=28%2026.05 | — | — | — | — | — | 81.6 | |
| AsymVLMKeep ratio=65%, FLOPs Saved=39%2026.05 | — | — | — | — | — | 81.5 | |
| AsymVLMKeep ratio=50%, FLOPs Saved=54%2026.05 | — | — | — | — | — | 81.3 | |
| BaselineKeep ratio=100%, FLOPs Saved=—2026.05 | — | — | — | — | — | 80.9 | |
| BLIP-2Params (#trainable)=13B, Text Backbone=AR, Image Backbone=-2024.12 | — | — | — | — | — | 1,293.8 | |
| D-DiTParams (#trainable)=2B, Text Backbone=Diffusion, Image Backbone=Diffusion, Input Resolution=256x2562024.12 | — | — | — | — | — | 897.5 | |
| D-DiTParams (#trainable)=2B, Text Backbone=Diffusion, Image Backbone=Diffusion, Input Resolution=512x5122024.12 | — | — | — | — | — | 1,124.7 | |
| FastVKeep ratio=75%, FLOPs Saved=0%2026.05 | — | — | — | — | — | 81.4 | |
| FastVKeep ratio=65%, FLOPs Saved=0%2026.05 | — | — | — | — | — | 81.2 | |
| FastVKeep ratio=50%, FLOPs Saved=0%2026.05 | — | — | — | — | — | 81.2 | |
| InternVL-2.0Params (#trainable)=8B, Text Backbone=AR, Image Backbone=-2024.12 | — | — | — | — | — | 1,648.1 | |
| LLaVA-NextParams (#trainable)=13B, Text Backbone=AR, Image Backbone=-2024.12 | — | — | — | — | — | 1,575 | |
| QWEN-VLParams (#trainable)=7B, Text Backbone=AR, Image Backbone=-2024.12 | — | — | — | — | — | 1,487.5 | |
| Show-OParams (#trainable)=1.3B, Text Backbone=AR, Image Backbone=Diffusion, Input Resolution=256x2562024.12 | — | — | — | — | — | 1,014.9 | |
| Show-OParams (#trainable)=1.3B, Text Backbone=AR, Image Backbone=Diffusion, Input Resolution=512x5122024.12 | — | — | — | — | — | 1,097.2 | |
| SparseVLMKeep ratio=75%, FLOPs Saved=18%2026.05 | — | — | — | — | — | 81.4 | |
| SparseVLMKeep ratio=65%, FLOPs Saved=35%2026.05 | — | — | — | — | — | 81.4 | |
| SparseVLMKeep ratio=50%, FLOPs Saved=47%2026.05 | — | — | — | — | — | 81.2 |