Multimodal Benchmarking on MMBench (Score and Relative Performance)
83.33MMBench ScoreTraining-Free Debiasing Inference Strategy
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Training-Free Debiasing Inference StrategyModel=Qwen2.5-VL-7B, Strategy=Ours2026.05 | 83.33 | — | |
| DMASModel=Qwen2.5-VL-7B, Strategy=DMAS2026.05 | 83.2 | — | |
| VISTAModel=Qwen2.5-VL-7B, Strategy=VISTA2026.05 | 82.7 | — | |
| VCDModel=Qwen2.5-VL-7B, Strategy=VCD2026.05 | 82.55 | — | |
| SIDModel=Qwen2.5-VL-7B, Strategy=SID2026.05 | 82.15 | — | |
| Zero-shotModel=Qwen2.5-VL-7B, Strategy=Zero-shot2026.05 | 81.13 | — | |
| Full ModelBase Model=LLaVA-NeXT, Sparsity Ratio=0%2026.04 | 72.2 | — | |
| TopoVLMBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 68.1 | — | |
| TAMPBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 66.5 | — | |
| LLM-StreamlineBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 66.3 | — | |
| ECoFLaPBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 66.2 | — | |
| SparseGPTBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 65.7 | — | |
| PDrop+EEnergy Threshold (τ)=99.8%, Adaptive Budget (+E)=true, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=2612026.03 | 65.2 | 101.4 | |
| PDropEnergy Threshold (τ)=99.8%, Adaptive Budget (+E)=false, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=2612026.03 | 65 | 101.1 | |
| FastV+EEnergy Threshold (τ)=99.8%, Adaptive Budget (+E)=true, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=2612026.03 | 64.7 | 100.6 | |
| VanillaRetained Tokens=576, Base Model=LLaVA-v1.5-7B2026.04 | 64.7 | 100 | |
| BaseBackbone=LLaVA-1.5-7B2026.03 | 64.3 | — | |
| VisionZip+EEnergy Threshold (τ)=99.8%, Adaptive Budget (+E)=true, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=2612026.03 | 64.1 | 99.7 | |
| LLM-PrunerBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 64.1 | — | |
| FastVEnergy Threshold (τ)=99.8%, Adaptive Budget (+E)=false, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=2612026.03 | 64 | 99.5 | |
| VisionZipEnergy Threshold (τ)=99.8%, Adaptive Budget (+E)=false, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=2612026.03 | 64 | 99.5 | |
| FastVEnergy Threshold (τ)=99.0%, Adaptive Budget (+E)=false, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=1302026.03 | 63.8 | 99.2 | |
| WandaBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 63.8 | — | |
| LearnPrunerRetained Tokens=128, Params.=0.53M, Base Model=LLaVA-v1.5-7B2026.04 | 63.8 | 98.5 | |
| Training-Free Debiasing Inference StrategyModel=LLaVA-1.5-7B, Strategy=Ours2026.05 | 63.7 | — | |
| SIDModel=LLaVA-1.5-7B, Strategy=SID2026.05 | 63.65 | — | |
| TwigVLMRetained Tokens=128, Params.=610M, Base Model=LLaVA-v1.5-7B2026.04 | 63.5 | 99 | |
| DMASModel=LLaVA-1.5-7B, Strategy=DMAS2026.05 | 63.3 | — | |
| VCDModel=LLaVA-1.5-7B, Strategy=VCD2026.05 | 63.1 | — | |
| FastV+EEnergy Threshold (τ)=99.0%, Adaptive Budget (+E)=true, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=1302026.03 | 63 | 98 | |
| PDropEnergy Threshold (τ)=99.0%, Adaptive Budget (+E)=false, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=1302026.03 | 63 | 98 | |
| VisPrunerRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 62.7 | 97.3 | |
| VISTAModel=LLaVA-1.5-7B, Strategy=VISTA2026.05 | 62.7 | — | |
| VisionZip ‡Retained Tokens=128, Params.=20.9M, Base Model=LLaVA-v1.5-7B2026.04 | 62.6 | 97.3 | |
| LearnPrunerRetained Tokens=64, Params.=0.53M, Base Model=LLaVA-v1.5-7B2026.04 | 62.6 | 96.9 | |
| VisionZip+EEnergy Threshold (τ)=99.0%, Adaptive Budget (+E)=true, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=1302026.03 | 62.5 | 97.2 | |
| VisionZipEnergy Threshold (τ)=99.0%, Adaptive Budget (+E)=false, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=1302026.03 | 62.2 | 96.7 | |
| PDrop+EEnergy Threshold (τ)=99.0%, Adaptive Budget (+E)=true, Backbone=LLaVA-1.5-7B, Mean Effective Token Count=1302026.03 | 62 | 96.4 | |
| DivPruneRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 62 | 96.4 | |
| VisionZipRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 62 | 96.3 | |
| Zero-shotModel=LLaVA-1.5-7B, Strategy=Zero-shot2026.05 | 62 | — | |
| VisionZip ‡Retained Tokens=64, Params.=20.9M, Base Model=LLaVA-v1.5-7B2026.04 | 61.5 | 95.1 | |
| VisPrunerRetained Tokens=64, Base Model=LLaVA-v1.5-7B2026.04 | 61.3 | 94.3 | |
| OWLBase Model=LLaVA-NeXT, Sparsity Ratio=50%, Calibration Sets=3 (Average)2026.04 | 61 | — | |
| LearnPrunerRetained Tokens=32, Params.=0.53M, Base Model=LLaVA-v1.5-7B2026.04 | 60.8 | 94.8 | |
| DARTRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 60.7 | 95.4 | |
| TwigVLMRetained Tokens=64, Params.=610M, Base Model=LLaVA-v1.5-7B2026.04 | 60.4 | 96 | |
| VisionZipRetained Tokens=64, Base Model=LLaVA-v1.5-7B2026.04 | 60.1 | 93 | |
| SparseVLMRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 60 | 92.6 | |
| DARTRetained Tokens=64, Base Model=LLaVA-v1.5-7B2026.04 | 59.5 | 91.9 | |
| DivPruneRetained Tokens=64, Base Model=LLaVA-v1.5-7B2026.04 | 59.3 | 93.9 | |
| DARTRetained Tokens=32, Base Model=LLaVA-v1.5-7B2026.04 | 58.5 | 88 | |
| VisPrunerRetained Tokens=32, Base Model=LLaVA-v1.5-7B2026.04 | 58.4 | 89.7 | |
| VisionZipRetained Tokens=32, Base Model=LLaVA-v1.5-7B2026.04 | 57.7 | 87.8 | |
| DivPruneRetained Tokens=32, Base Model=LLaVA-v1.5-7B2026.04 | 57.6 | 90.5 | |
| SparseVLMRetained Tokens=64, Base Model=LLaVA-v1.5-7B2026.04 | 56.2 | 85.6 | |
| FastVRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 56.1 | 82.1 | |
| SparseVLMRetained Tokens=32, Base Model=LLaVA-v1.5-7B2026.04 | 51.4 | 77.5 | |
| FastVRetained Tokens=64, Base Model=LLaVA-v1.5-7B2026.04 | 48 | 71.4 | |
| FastVRetained Tokens=32, Base Model=LLaVA-v1.5-7B2026.04 | 37.8 | 58.6 |