Multimodal Model Evaluation on MME (MME Metric)
2,489.7MME ScoreInternVL3.5-38B
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL3.5-38BRatio=100%, Backbone=InternVL3.5-38B2026.05 | 2,489.7 | |
| FP16Spiking=false, Time Step=N/A, Backbone=Qwen2VL-72B2026.04 | 2,480 | |
| SpikeMLLM (QuaRot+MSTS+TC-LIF)Spiking=true, Time Step=3/4, Backbone=Qwen2VL-72B2026.04 | 2,451 | |
| F3ARatio=60%, Backbone=InternVL3.5-38B2026.05 | 2,430.9 | |
| FULLModel=Qwen3-VL (4B), Selection Ratio=100%2026.05 | 2,429.7 | |
| FastVRatio=60%, Backbone=InternVL3.5-38B2026.05 | 2,426.6 | |
| SpikeMLLM(SQ)Spiking=true, Time Step=255, Backbone=Qwen2VL-72B2026.04 | 2,419 | |
| CDPrunerRatio=60%, Backbone=InternVL3.5-38B2026.05 | 2,417.8 | |
| VisionZipRatio=60%, Backbone=InternVL3.5-38B2026.05 | 2,403.6 | |
| RANDOMModel=Qwen3-VL (4B), Selection Ratio=20%2026.05 | 2,401 | |
| Honeybee-Remake-SEED-200KModel=Qwen3-VL (4B), Selection Ratio=20%2026.05 | 2,398.1 | |
| DivPruneRatio=60%, Backbone=InternVL3.5-38B2026.05 | 2,389.7 | |
| F3ARatio=40%, Backbone=InternVL3.5-38B2026.05 | 2,365.3 | |
| Training-Free Debiasing Inference StrategyModel=Qwen2.5-VL-7B, Strategy=Ours2026.05 | 2,355.2 | |
| DMASModel=Qwen2.5-VL-7B, Strategy=DMAS2026.05 | 2,346 | |
| SIDModel=Qwen2.5-VL-7B, Strategy=SID2026.05 | 2,342.8 | |
| VisionZipRatio=40%, Backbone=InternVL3.5-38B2026.05 | 2,341.8 | |
| VISTAModel=Qwen2.5-VL-7B, Strategy=VISTA2026.05 | 2,338.1 | |
| VCDModel=Qwen2.5-VL-7B, Strategy=VCD2026.05 | 2,335.7 | |
| SpikeMLLM(MBQ)Spiking=true, Time Step=255, Backbone=Qwen2VL-72B2026.04 | 2,331 | |
| Zero-shotModel=Qwen2.5-VL-7B, Strategy=Zero-shot2026.05 | 2,328.1 | |
| CDPrunerRatio=40%, Backbone=InternVL3.5-38B2026.05 | 2,321.4 | |
| Vanilla2026.04 | 2,319 | |
| DivPruneRatio=40%, Backbone=InternVL3.5-38B2026.05 | 2,318.2 | |
| BASEModel=Qwen3-VL (4B), Selection Ratio=0%2026.05 | 2,279.5 | |
| Honeybee-Remake-SEED-200KModel=LLaVA-OneVision-1.5 (4B), Selection Ratio=20%2026.05 | 2,260.8 | |
| RANDOMModel=LLaVA-OneVision-1.5 (4B), Selection Ratio=20%2026.05 | 2,256.7 | |
| BASEModel=LLaVA-OneVision-1.5 (4B), Selection Ratio=0%2026.05 | 2,248.7 | |
| FULLModel=LLaVA-OneVision-1.5 (4B), Selection Ratio=100%2026.05 | 2,244.7 | |
| FastVRatio=40%, Backbone=InternVL3.5-38B2026.05 | 2,235.6 | |
| F3ARatio=20%, Backbone=InternVL3.5-38B2026.05 | 2,230.7 | |
| FastVRatio=20%, Backbone=InternVL3.5-38B2026.05 | 2,158.3 | |
| VisionZipRatio=20%, Backbone=InternVL3.5-38B2026.05 | 2,146.8 | |
| DASHViT retain tokens=50%, LLM retain tokens=50%2026.04 | 2,116 | |
| DART (ViT)ViT retain tokens=50%, LLM retain tokens=50%2026.04 | 2,113 | |
| DivPruneRatio=20%, Backbone=InternVL3.5-38B2026.05 | 2,097.1 | |
| CDPrunerRatio=20%, Backbone=InternVL3.5-38B2026.05 | 2,089.6 | |
| ToMeViT retain tokens=50%, LLM retain tokens=50%2026.04 | 2,007 | |
| DASHViT retain tokens=35%, LLM retain tokens=35%2026.04 | 1,987 | |
| DART (ViT)ViT retain tokens=35%, LLM retain tokens=35%2026.04 | 1,968 | |
| LLaVA-Qwen-7B (Instruct)Model=LLaVA-Qwen-7B (Instruct)2025.02 | 1,935.4 | |
| ToFuViT retain tokens=50%, LLM retain tokens=50%2026.04 | 1,933 | |
| LLaVA-Qwen-7B (Base)Model=LLaVA-Qwen-7B (Base)2025.02 | 1,923.1 | |
| PRISM-Qwen-7B (Instruct)Model=PRISM-Qwen-7B (Instruct)2025.02 | 1,908.6 | |
| PRISM-Qwen-7B (Base)Model=PRISM-Qwen-7B (Base)2025.02 | 1,895.8 | |
| LLaVA-Llama-8BModel=LLaVA-Llama-8B2025.02 | 1,889.7 | |
| PRISM-Llama-8BModel=PRISM-Llama-8B2025.02 | 1,862.5 | |
| PRISM-13BModel=PRISM-13B2025.02 | 1,846 | |
| ToMeViT retain tokens=35%, LLM retain tokens=35%2026.04 | 1,842 | |
| ToFuViT retain tokens=35%, LLM retain tokens=35%2026.04 | 1,839 | |
| LLaVA-Vicuna-13BModel=LLaVA-Vicuna-13B2025.02 | 1,826.7 | |
| LLaVA-Vicuna-7BModel=LLaVA-Vicuna-7B2025.02 | 1,822.6 | |
| PRISM-7BModel=PRISM-7B2025.02 | 1,800 | |
| SyVLA2026.06 | 1,795 | |
| PRISM-3BModel=PRISM-3B2025.02 | 1,790.5 | |
| LLaVA-1.5-13BToken=576, Backbone=LLaVA-1.5-13B2026.04 | 1,789.68 | |
| RCPToken=192, Backbone=LLaVA-1.5-13B2026.04 | 1,786.1 | |
| Training-Free Debiasing Inference StrategyModel=LLaVA-1.5-7B, Strategy=Ours2026.05 | 1,771.3 | |
| DMASModel=LLaVA-1.5-7B, Strategy=DMAS2026.05 | 1,770.4 | |
| SIDModel=LLaVA-1.5-7B, Strategy=SID2026.05 | 1,769.2 | |
| VCDModel=LLaVA-1.5-7B, Strategy=VCD2026.05 | 1,766 | |
| LLaVA-Phi2-3BModel=LLaVA-Phi2-3B2025.02 | 1,765.7 | |
| Zero-shotModel=LLaVA-1.5-7B, Strategy=Zero-shot2026.05 | 1,762.5 | |
| VISTAModel=LLaVA-1.5-7B, Strategy=VISTA2026.05 | 1,760 | |
| RCPToken=128, Backbone=LLaVA-1.5-13B2026.04 | 1,742.43 | |
| RCPToken=64, Backbone=LLaVA-1.5-13B2026.04 | 1,660.29 | |
| MAGICTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 1,551.5 | |
| Full-FinetuneTarget Model=LLaVA-1.5-13B, Data Budget=100%2026.05 | 1,541.7 | |
| EL2NTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 1,531 | |
| COINCIDETarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 1,516.8 | |
| FastVToken=192, Backbone=LLaVA-1.5-13B2026.04 | 1,515.86 | |
| PerplexityTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 1,508.8 | |
| RandomTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 1,484.9 | |
| Self-SupTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 1,463.8 | |
| D2-PruningTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 1,463 | |
| Self-FilterTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 1,446.9 | |
| ChatVLA2026.06 | 1,435 | |
| CLIP-ScoreTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 1,426.3 | |
| SemDedupTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 1,397.6 | |
| Wall-Oss2026.06 | 1,146.56 |