Multi-modal Evaluation on MME (Cognition and Perception Scores)
1,731MME Perception ScoreVanilla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VanillaToken Retention Ratio=100%2026.05 | 1,731 | 704 | |
| DARTToken Retention Ratio=70%2026.05 | 1,724 | 702 | |
| SPprunerToken Retention Ratio=70%2026.05 | 1,712 | 709 | |
| SPprunerToken Retention Ratio=50%2026.05 | 1,711 | 689 | |
| BAGEL (Ours)Baseline=BAGEL, Params=7B active2026.06 | 1,701.7 | 715.9 | |
| BLIP3o-8B (Ours)Baseline=BLIP3o-8B, Params=8B2026.06 | 1,698.4 | 660.3 | |
| DARTToken Retention Ratio=50%2026.05 | 1,696 | 664 | |
| VARGPT-v1.1 (Ours)Baseline=VARGPT-v1.1, Params=7B+2B2026.06 | 1,695.7 | 606.4 | |
| BAGELBaseline=BAGEL, Params=7B active2026.06 | 1,687 | 701 | |
| BLIP3o-8BBaseline=BLIP3o-8B, Params=8B2026.06 | 1,682.6 | 647.1 | |
| VARGPT-v1.1Baseline=VARGPT-v1.1, Params=7B+2B2026.06 | 1,678.3 | 592.9 | |
| FastVToken Retention Ratio=70%2026.05 | 1,674 | 718 | |
| SPprunerToken Retention Ratio=30%2026.05 | 1,662 | 657 | |
| UniCornBaseline=BAGEL, Params=7B active2026.06 | 1,660 | 677 | |
| DARTToken Retention Ratio=30%2026.05 | 1,654 | 625 | |
| FastVToken Retention Ratio=50%2026.05 | 1,628 | 698 | |
| Full ModelBase Model=LLaVA-NeXT, Sparsity Ratio=0%2026.04 | 1,588.3 | 376.8 | |
| Janus-Pro-7BBaseline=Janus-Pro-7B, Params=7B2026.06 | 1,567.1 | — | |
| TokenFlowBaseline=TokenFlow2026.06 | 1,551.1 | 371.1 | |
| FastVToken Retention Ratio=30%2026.05 | 1,523 | 580 | |
| TopoVLMBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 1,506.7 | 352.4 | |
| FullFTTrainable=7B2026.06 | 1,500 | 350 | |
| DPVR-PCTrainable=202M, evaluation=3-seed average2026.06 | 1,499 | 326 | |
| LoRATrainable=20M, r=162026.06 | 1,495 | 358 | |
| LoRATrainable=80M, r=642026.06 | 1,491 | 346 | |
| DPVR-KVTrainable=202M2026.06 | 1,480 | 322 | |
| DPVR-LFTrainable=202M, evaluation=3-seed average2026.06 | 1,468 | 326 | |
| TAMPBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 1,461.3 | 337.2 | |
| Vanilla LLaVA-1.5-7BTrainable=02026.06 | 1,457 | 318 | |
| SEED-XBaseline=SEED-X2026.06 | 1,457 | — | |
| FastVTrainable=0, mode=inference-only2026.06 | 1,450 | 334 | |
| SparseGPTBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 1,447.9 | 313 | |
| ILLUMEBaseline=Vicuna-7B, Params=7B2026.06 | 1,445.3 | — | |
| ECoFLaPBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 1,439.9 | 273 | |
| LLM-StreamlineBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 1,428.5 | 321.6 | |
| VILA-UBaseline=VILA-U2026.06 | 1,401.8 | — | |
| LLM-PrunerBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 1,372.1 | 298.4 | |
| WandaBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 1,348.3 | 286.7 | |
| JanusBaseline=Janus2026.06 | 1,338 | — | |
| OWLBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 1,335.6 | 271.9 | |
| Emu3Baseline=Emu32026.06 | 1,243.8 | 266.1 | |
| Show-oBaseline=Show-o2026.06 | 1,232.9 | — | |
| ChameleonBaseline=Chameleon2026.06 | 202.7 | — |