Vision-Language Understanding on MMBench cn
60.6AccuracyVanilla
Evaluation Results
| Method | Links | |
|---|---|---|
| VanillaBackbone=LLaVA-NeXT-7B, Token Budget=2880 Tokens, Venue=-2026.02 | 60.6 | |
| VanillaBase Model=LLaVA-Next-7B, Token Reduction Rate=0.0%2025.05 | 60.6 | |
| VanillaBackbone=LLaVA-NeXT-7B, Retained Tokens=2880, Compression Ratio=100%2026.04 | 60.6 | |
| PIO-FVLMBackbone=LLaVA-NeXT-7B, Token Budget=320 Tokens, Venue=Ours2026.02 | 59.5 | |
| MoBBase Model=LLaVA-Next-7B, Pruning budget K=320, η-prior=true2025.05 | 58.9 | |
| DARTBackbone=LLaVA-NeXT-7B, Token Budget=320 Tokens, Venue=EMNLP’252026.02 | 58.2 | |
| VanillaBase Model=LLaVA-1.5-7B, Token Reduction Rate=0.0%2025.05 | 58.1 | |
| MoBBase Model=LLaVA-1.5-7B, Pruning budget K=192, η-prior=true2025.05 | 57.8 | |
| HoloVBackbone=LLaVA-NeXT-7B, Token Budget=320 Tokens, Venue=NeurIPS’252026.02 | 57.5 | |
| MoBBase Model=LLaVA-1.5-7B, Pruning budget K=128, η-prior=true2025.05 | 57.5 | |
| EvoCompBackbone=LLaVA-NeXT-7B, Retained Tokens=160, Compression Ratio=94.4%, l=02026.04 | 55.8 | |
| CDPrunerBackbone=LLaVA-NeXT-7B, Token Budget=320 Tokens, Venue=NeurIPS’252026.02 | 55.7 | |
| VisionZipBackbone=LLaVA-NeXT-7B, Token Budget=320 Tokens, Venue=CVPR’252026.02 | 55.6 | |
| SparseVLMBackbone=LLaVA-NeXT-7B, Token Budget=320 Tokens, Venue=ICML’252026.02 | 54.5 | |
| MoBBase Model=LLaVA-1.5-7B, Pruning budget K=64, η-prior=true2025.05 | 54.5 | |
| SparseVLMBackbone=LLaVA-NeXT-7B, Retained Tokens=160, Compression Ratio=94.4%2026.04 | 53.8 | |
| MustDropBackbone=LLaVA-NeXT-7B, Retained Tokens=160, Compression Ratio=94.4%2026.04 | 53.5 | |
| PyramidDropBackbone=LLaVA-NeXT-7B, Retained Tokens=160, Compression Ratio=94.4%2026.04 | 53.4 | |
| FastVBackbone=LLaVA-NeXT-7B, Retained Tokens=160, Compression Ratio=94.4%2026.04 | 53.1 | |
| DARTBackbone=LLaVA-NeXT-7B, Retained Tokens=160, Compression Ratio=94.4%2026.04 | 52.6 | |
| VisionZipBackbone=LLaVA-NeXT-7B, Retained Tokens=160, Compression Ratio=94.4%2026.04 | 52.1 | |
| FastVBackbone=LLaVA-NeXT-7B, Token Budget=320 Tokens, Venue=ECCV’242026.02 | 51.9 | |
| GlobalCom^2Backbone=LLaVA-NeXT-7B, Retained Tokens=160, Compression Ratio=94.4%2026.04 | 50.9 | |
| DARTBackbone=LLaVA-NeXT-7B, Retained Tokens=160, Compression Ratio=94.4%, l=02026.04 | 47.8 | |
| GKL-KDCLIP Model=GKL-KD2025.03 | 43.38 | |
| KL-KDCLIP Model=KL-KD [27]2025.03 | 42.01 | |
| BaselineCLIP Model=Baseline2025.03 | 39.86 |