Visual Perception on MME Perception
1,742MME^PInternVL2-7B + SCR
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL2-7B + SCRConfiguration=Spatial Credit Redistribution2026.02 | 1,742 | |
| InternVL2-7BConfiguration=Vanilla2026.02 | 1,685 | |
| Qwen2-VL-7B + SCRConfiguration=Spatial Credit Redistribution2026.02 | 1,678 | |
| LLaVA-13B + SCRConfiguration=Spatial Credit Redistribution2026.02 | 1,642 | |
| Qwen2-VL-7BConfiguration=Vanilla2026.02 | 1,620 | |
| Qwen-VL + SCRConfiguration=Spatial Credit Redistribution2026.02 | 1,612 | |
| LLaVA-13BConfiguration=Vanilla2026.02 | 1,588 | |
| LLaVA-7B + SCRConfiguration=Spatial Credit Redistribution2026.02 | 1,576 | |
| ShareGPT4VLLM=Vicuna-7B, Resolution=3362026.03 | 1,567.4 | |
| PDrop (training-based)Base Model=LLaVA-1.5-13B, Pruning Strategy=training-based, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=270, Vision-side TFLOPs (Rel.)=6.92 (46.4%)2026.02 | 1,555.2 | |
| Dynamic-LLaVABase Model=LLaVA-1.5-13B, Pruning Strategy=training-based, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=115, Vision-side TFLOPs (Rel.)=2.93 (19.7%)2026.02 | 1,554.1 | |
| Qwen-VLConfiguration=Vanilla2026.02 | 1,548 | |
| LLaVA-v1.5LLM=Vicuna-1.5-13B, Resolution=3362026.03 | 1,531.3 | |
| Original (LLaVA-1.5-13B)Base Model=LLaVA-1.5-13B, Pruning Strategy=None (Baseline), Sparsity (Op.)=false, Sparsity (Tok.)=false, Vision-side Token=576, Vision-side TFLOPs (Rel.)=14.91 (100.0%)2026.02 | 1,529.9 | |
| Delta-LLaVABase Model=LLaVA-1.5-13B, Pruning Strategy=training-based, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=144, Vision-side TFLOPs (Rel.)=3.68 (24.7%)2026.02 | 1,527.5 | |
| LLaVA-7BConfiguration=Vanilla2026.02 | 1,510 | |
| TwigVLMBase Model=LLaVA-1.5-13B, Pruning Strategy=training-based, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=64, Vision-side TFLOPs (Rel.)=1.63 (10.9%)2026.02 | 1,503.1 | |
| TokLIPLLM=Qwen2.5-7B-Inst., Resolution=3842026.03 | 1,488.4 | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution=4482026.03 | 1,478.5 | |
| DOP_CDBase Model=LLaVA-1.5-13B, Pruning Strategy=training-free, Sparsity (Op.)=true, Sparsity (Tok.)=true, Vision-side Token=32, Vision-side TFLOPs (Rel.)=0.81 (5.5%)2026.02 | 1,468.9 | |
| VISABase Model=LLaVA-1.5-13B, Pruning Strategy=training-free, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=64, Vision-side TFLOPs (Rel.)=1.63 (10.9%)2026.02 | 1,468.3 | |
| EvoTokLLM=Qwen-2.5-7B-Inst., Resolution=2562026.03 | 1,455.9 | |
| ViCABase Model=LLaVA-1.5-13B, Pruning Strategy=training-based (our architecture), Sparsity (Op.)=true, Sparsity (Tok.)=false, Vision-side Token=19, Vision-side TFLOPs (Rel.)=0.49 (3.3%)2026.02 | 1,453.6 | |
| ILLUMELLM=Vicuna-7B, Resolution=-2026.03 | 1,445.3 | |
| ViCA+PDrop†Base Model=LLaVA-1.5-13B, Pruning Strategy=training-based (our architecture + inference drop), Sparsity (Op.)=true, Sparsity (Tok.)=true, Vision-side Token=10, Vision-side TFLOPs (Rel.)=0.26 (1.7%)2026.02 | 1,442.1 | |
| YOPOBase Model=LLaVA-1.5-13B, Pruning Strategy=training-based, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=70, Vision-side TFLOPs (Rel.)=1.78 (12.0%)2026.02 | 1,430 | |
| LLaVA-PruMergeBase Model=LLaVA-1.5-13B, Pruning Strategy=training-based, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=32, Vision-side TFLOPs (Rel.)=0.81 (5.5%)2026.02 | 1,428.6 | |
| CDPrunerBase Model=LLaVA-1.5-13B, Pruning Strategy=training-free, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=32, Vision-side TFLOPs (Rel.)=0.81 (5.5%)2026.02 | 1,421 | |
| Cham-30B + SCRConfiguration=Spatial Credit Redistribution2026.02 | 1,418 | |
| DivPruneBase Model=LLaVA-1.5-13B, Pruning Strategy=training-free, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=32, Vision-side TFLOPs (Rel.)=0.81 (5.5%)2026.02 | 1,405.2 | |
| SparseVLMBase Model=LLaVA-1.5-13B, Pruning Strategy=training-free, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=64, Vision-side TFLOPs (Rel.)=1.63 (10.9%)2026.02 | 1,374.3 | |
| DOP_vBase Model=LLaVA-1.5-13B, Pruning Strategy=training-free, Sparsity (Op.)=true, Sparsity (Tok.)=true, Vision-side Token=32, Vision-side TFLOPs (Rel.)=0.81 (5.5%)2026.02 | 1,365.6 | |
| TokenFlow-LLLM=Vicuna-13B, Resolution=2562026.03 | 1,365.4 | |
| Cham-7B + SCRConfiguration=Spatial Credit Redistribution2026.02 | 1,358 | |
| SemHiTokLLM=Qwen2.5-7B, Resolution=2562026.03 | 1,355.8 | |
| TokenFlow-BLLM=Vicuna-13B, Resolution=2242026.03 | 1,353.6 | |
| Cham-30BConfiguration=Vanilla2026.02 | 1,342 | |
| TRIMBase Model=LLaVA-1.5-13B, Pruning Strategy=training-based, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=29, Vision-side TFLOPs (Rel.)=0.74 (4.9%)2026.02 | 1,337.9 | |
| VisPrunerBase Model=LLaVA-1.5-13B, Pruning Strategy=training-free, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=32, Vision-side TFLOPs (Rel.)=0.81 (5.5%)2026.02 | 1,314.2 | |
| ToMeBase Model=LLaVA-1.5-13B, Pruning Strategy=training-free, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=64, Vision-side TFLOPs (Rel.)=1.63 (10.9%)2026.02 | 1,287 | |
| Cham-7BConfiguration=Vanilla2026.02 | 1,285 | |
| DARTBase Model=LLaVA-1.5-13B, Pruning Strategy=training-free, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=32, Vision-side TFLOPs (Rel.)=0.81 (5.5%)2026.02 | 1,282.8 | |
| Original (LLaVA-1.5-3B)Base Model=LLaVA-1.5-3B, Pruning Strategy=None (Baseline), Sparsity (Op.)=false, Sparsity (Tok.)=false, Vision-side Token=576, Vision-side TFLOPs (Rel.)=3.04 (100.0%)2026.02 | 1,258.2 | |
| VisionZip (training-free)Base Model=LLaVA-1.5-13B, Pruning Strategy=training-free, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=32, Vision-side TFLOPs (Rel.)=0.81 (5.5%)2026.02 | 1,257.7 | |
| PDrop (training-free)Base Model=LLaVA-1.5-13B, Pruning Strategy=training-free, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=64, Vision-side TFLOPs (Rel.)=1.63 (10.9%)2026.02 | 1,247 | |
| FastVBase Model=LLaVA-1.5-13B, Pruning Strategy=training-free, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=64, Vision-side TFLOPs (Rel.)=1.63 (10.9%)2026.02 | 1,246.4 | |
| PDropBase Model=LLaVA-1.5-3B, Pruning Strategy=training-based, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=270, Vision-side TFLOPs (Rel.)=1.40 (46.0%)2026.02 | 1,231.1 | |
| ViCABase Model=LLaVA-1.5-3B, Pruning Strategy=training-based (our architecture), Sparsity (Op.)=true, Sparsity (Tok.)=false, Vision-side Token=27, Vision-side TFLOPs (Rel.)=0.14 (4.5%)2026.02 | 1,188.9 | |
| ViCA+PDrop†Base Model=LLaVA-1.5-3B, Pruning Strategy=training-based (our architecture + inference drop), Sparsity (Op.)=true, Sparsity (Tok.)=true, Vision-side Token=12, Vision-side TFLOPs (Rel.)=0.06 (2.0%)2026.02 | 1,187.5 | |
| YOPOBase Model=LLaVA-1.5-3B, Pruning Strategy=training-based, Sparsity (Op.)=false, Sparsity (Tok.)=true, Vision-side Token=70, Vision-side TFLOPs (Rel.)=0.37 (12.0%)2026.02 | 1,106.5 |