Multimodal Model Evaluation on MME (Score and Relative Performance)
2,307.6ScoreQwen2.5-VL-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-VL-7BToken Retention=100%2026.06 | 2,307.6 | — | |
| CDPrunerToken Retention=20%2026.06 | 2,166.9 | — | |
| DAP-ICoTBackbone=Qwen2-VL-7B, Shots=1-Shot2026.03 | 2,076 | — | |
| DAP-ICoTBackbone=Qwen2-VL-7B, Shots=0-Shot2026.03 | 2,012.2 | — | |
| CDPrunerToken Retention=10%2026.06 | 2,008.7 | — | |
| SPAREToken Retention=20%2026.06 | 1,997.3 | — | |
| CCoTBackbone=Qwen2-VL-7B, Shots=1-Shot2026.03 | 1,941.9 | — | |
| SPAREToken Retention=10%2026.06 | 1,923.3 | — | |
| MMCoTBackbone=Qwen2-VL-7B, Shots=1-Shot2026.03 | 1,874.3 | — | |
| CCoTBackbone=Qwen2-VL-7B, Shots=0-Shot2026.03 | 1,866.3 | — | |
| DAP-ICoTBackbone=Qwen2-VL-2B, Shots=1-Shot2026.03 | 1,862.4 | — | |
| LLaVA-1.5-7BAverage Tokens=576, Token Reduction (%)=0%2026.02 | 1,862 | 100 | |
| FitPruneAverage Tokens=192, Token Reduction (%)=66.7%2026.02 | 1,831 | 98.3 | |
| No SpecializationBackbone=Qwen3-MoE (A3B/30B, top-8/128 experts)2026.04 | 1,830 | — | |
| DDCoTBackbone=Qwen2-VL-7B, Shots=1-Shot2026.03 | 1,826.6 | — | |
| CLSEBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 1,826 | — | |
| SCAFFOLDBackbone=Qwen2-VL-7B, Shots=1-Shot2026.03 | 1,822.2 | — | |
| DUET-VLM (C)Average Tokens=192, Token Reduction (%)=66.7%2026.02 | 1,817 | 97.6 | |
| VanillaBase Model=LLaVA-1.5-13B, Retain Tokens=576, Retention Ratio=100%2026.06 | 1,816 | — | |
| PyramidDropAverage Tokens=192, Token Reduction (%)=66.7%2026.02 | 1,797 | 96.5 | |
| FiCoCo-VBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 1,791 | — | |
| PDropBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 1,786 | — | |
| CLSEBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 1,785 | — | |
| VisionZipAverage Tokens=192, Token Reduction (%)=66.7%2026.02 | 1,783 | 95.8 | |
| FitPruneAverage Tokens=128, Token Reduction (%)=77.8%2026.02 | 1,776 | 95.4 | |
| SMOESBackbone=Qwen3-MoE (A3B/30B, top-8/128 experts), Estimator Type=attention-soft2026.04 | 1,775 | — | |
| SparseVLMBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 1,774 | — | |
| SparseVLMBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 1,768 | — | |
| DUET-VLM (C)Average Tokens=128, Token Reduction (%)=77.8%2026.02 | 1,767 | 94.9 | |
| VisionZipAverage Tokens=128, Token Reduction (%)=77.8%2026.02 | 1,762 | 94.6 | |
| PyramidDropAverage Tokens=128, Token Reduction (%)=77.8%2026.02 | 1,761 | 94.6 | |
| DDCoTBackbone=Qwen2-VL-7B, Shots=0-Shot2026.03 | 1,752.4 | — | |
| DUET-VLM (C)Average Tokens=64, Token Reduction (%)=88.9%2026.02 | 1,751 | 94 | |
| PDropBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 1,744 | — | |
| HiREDAverage Tokens=192, Token Reduction (%)=66.7%2026.02 | 1,737 | 93.3 | |
| CLSEBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 1,728 | — | |
| DAP-ICoTBackbone=LLaVA-V1.5-13B, Shots=1-Shot2026.03 | 1,726.3 | — | |
| SparseVLMAverage Tokens=192, Token Reduction (%)=66.7%2026.02 | 1,721 | 92.4 | |
| No SpecializationBackbone=Moonlight-MoE (A3B/16B, top-6/64 experts)2026.04 | 1,715 | — | |
| HiREDAverage Tokens=128, Token Reduction (%)=77.8%2026.02 | 1,710 | 91.8 | |
| FiCoCo-VBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 1,710 | — | |
| ICoTBackbone=Qwen2-VL-7B, Shots=1-Shot2026.03 | 1,709.3 | — | |
| SparseVLMAverage Tokens=128, Token Reduction (%)=77.8%2026.02 | 1,696 | 91.1 | |
| VisionZipAverage Tokens=64, Token Reduction (%)=88.9%2026.02 | 1,690 | 90.8 | |
| FastVBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 1,673 | — | |
| SMOESBackbone=Moonlight-MoE (A3B/16B, top-6/64 experts), Estimator Type=gaussian-soft2026.04 | 1,671 | — | |
| SCAFFOLDBackbone=Qwen2-VL-7B, Shots=0-Shot2026.03 | 1,668.2 | — | |
| DirectBackbone=Qwen2-VL-7B, Shots=1-Shot2026.03 | 1,641.3 | — | |
| FastVBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 1,641 | — | |
| PruMergeAverage Tokens=192, Token Reduction (%)=66.7%2026.02 | 1,632 | 87.6 | |
| FiCoCo-VBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 1,615 | — | |
| FastVAverage Tokens=192, Token Reduction (%)=66.7%2026.02 | 1,612 | 86.6 | |
| MMCoTBackbone=Qwen2-VL-7B, Shots=0-Shot2026.03 | 1,602.5 | — | |
| DirectBackbone=Qwen2-VL-7B, Shots=0-Shot2026.03 | 1,599.3 | — | |
| HiREDAverage Tokens=64, Token Reduction (%)=88.9%2026.02 | 1,599 | 85.9 | |
| ICoTBackbone=Qwen2-VL-7B, Shots=0-Shot2026.03 | 1,587.3 | — | |
| FastVBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 1,567 | — | |
| PyramidDropAverage Tokens=64, Token Reduction (%)=88.9%2026.02 | 1,561 | 83.8 | |
| DAP-ICoTBackbone=LLaVA-V1.5-13B, Shots=0-Shot2026.03 | 1,556.3 | — | |
| FitPruneAverage Tokens=64, Token Reduction (%)=88.9%2026.02 | 1,556 | 83.6 | |
| PruMergeAverage Tokens=128, Token Reduction (%)=77.8%2026.02 | 1,554 | 83.5 | |
| PruMergeAverage Tokens=64, Token Reduction (%)=88.9%2026.02 | 1,549 | 83.2 | |
| SCAFFOLDBackbone=Qwen2-VL-2B, Shots=1-Shot2026.03 | 1,536.2 | — | |
| DAP-ICoTBackbone=LLaVA-V1.5-7B, Shots=1-Shot2026.03 | 1,526.9 | — | |
| ICoTBackbone=LLaVA-V1.5-13B, Shots=1-Shot2026.03 | 1,523.8 | — | |
| SparseVLMAverage Tokens=64, Token Reduction (%)=88.9%2026.02 | 1,505 | 80.8 | |
| FastVAverage Tokens=128, Token Reduction (%)=77.8%2026.02 | 1,490 | 80 | |
| ICoTBackbone=Qwen2-VL-2B, Shots=1-Shot2026.03 | 1,453.9 | — | |
| CCoTBackbone=LLaVA-V1.5-13B, Shots=1-Shot2026.03 | 1,442.3 | — | |
| PDropBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 1,441 | — | |
| ICoTBackbone=LLaVA-V1.5-7B, Shots=1-Shot2026.03 | 1,421.6 | — | |
| ICoTBackbone=LLaVA-V1.5-13B, Shots=0-Shot2026.03 | 1,405.4 | — | |
| SparseVLMBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 1,402 | — | |
| SCAFFOLDBackbone=LLaVA-V1.5-13B, Shots=1-Shot2026.03 | 1,389.9 | — | |
| DAP-ICoTBackbone=LLaVA-V1.5-7B, Shots=0-Shot2026.03 | 1,386.7 | — | |
| MMMaDA (Base)Base Model=MMMaDA2026.03 | 1,383.29 | — | |
| DAP-ICoTBackbone=Qwen2-VL-2B, Shots=0-Shot2026.03 | 1,378.9 | — | |
| MMMaDA + VISAGEBase Model=MMMaDA, Decoding Strategy=VISAGE2026.03 | 1,372.05 | — | |
| CCoTBackbone=LLaVA-V1.5-7B, Shots=1-Shot2026.03 | 1,349.5 | — | |
| SCAFFOLDBackbone=Qwen2-VL-2B, Shots=0-Shot2026.03 | 1,344.8 | — | |
| MMMaDA + VCDBase Model=MMMaDA, Decoding Strategy=VCD2026.03 | 1,342.21 | — | |
| ICoTBackbone=LLaVA-V1.5-7B, Shots=0-Shot2026.03 | 1,331.6 | — | |
| MMCoTBackbone=Qwen2-VL-2B, Shots=1-Shot2026.03 | 1,304.7 | — | |
| CCoTBackbone=LLaVA-V1.5-7B, Shots=0-Shot2026.03 | 1,294.3 | — | |
| MMCoTBackbone=LLaVA-V1.5-7B, Shots=1-Shot2026.03 | 1,277.4 | — | |
| SCAFFOLDBackbone=LLaVA-V1.5-7B, Shots=1-Shot2026.03 | 1,264.3 | — | |
| FastVAverage Tokens=64, Token Reduction (%)=88.9%2026.02 | 1,256 | 67.5 | |
| CCoTBackbone=LLaVA-V1.5-13B, Shots=0-Shot2026.03 | 1,249.3 | — | |
| SCAFFOLDBackbone=LLaVA-V1.5-13B, Shots=0-Shot2026.03 | 1,231.2 | — | |
| MMCoTBackbone=LLaVA-V1.5-13B, Shots=1-Shot2026.03 | 1,224.3 | — | |
| SCAFFOLDBackbone=LLaVA-V1.5-7B, Shots=0-Shot2026.03 | 1,170.3 | — | |
| MMCoTBackbone=LLaVA-V1.5-7B, Shots=0-Shot2026.03 | 1,140.2 | — | |
| DirectBackbone=LLaVA-V1.5-13B, Shots=1-Shot2026.03 | 1,118.5 | — | |
| MMCoTBackbone=Qwen2-VL-2B, Shots=0-Shot2026.03 | 1,102.8 | — | |
| DirectBackbone=LLaVA-V1.5-7B, Shots=1-Shot2026.03 | 1,079.8 | — | |
| MMCoTBackbone=LLaVA-V1.5-13B, Shots=0-Shot2026.03 | 1,078.1 | — | |
| DDCoTBackbone=LLaVA-V1.5-13B, Shots=1-Shot2026.03 | 1,034.1 | — | |
| DAP-ICoTBackbone=Chameleon-7B, Shots=1-Shot2026.03 | 1,013 | — | |
| DirectBackbone=LLaVA-V1.5-13B, Shots=0-Shot2026.03 | 995.4 | — | |
| DDCoTBackbone=LLaVA-V1.5-7B, Shots=1-Shot2026.03 | 991.8 | — |