Vision-Language Capability Evaluation on MME
2,349ScoreVanilla
Evaluation Results
| Method | Links | |
|---|---|---|
| VanillaBackbone=Qwen2.5-VL-7B, Token budget=100%2026.04 | 2,349 | |
| DASHBackbone=Qwen2.5-VL-7B, Token budget=25%2026.04 | 2,287 | |
| DARTBackbone=Qwen2.5-VL-7B, Token budget=25%2026.04 | 2,252 | |
| FastVBackbone=Qwen2.5-VL-7B, Token budget=25%2026.04 | 2,251 | |
| DivPruneBackbone=Qwen2.5-VL-7B, Token budget=25%2026.04 | 2,189 | |
| Baseline2026.02 | 1,594 | |
| IDPrunerRetain Tokens=25%2026.02 | 1,588 | |
| VisionSelectorRetain Tokens=25%2026.02 | 1,569 | |
| DARTRetain Tokens=25%2026.02 | 1,564 | |
| IDPrunerRetain Tokens=10%2026.02 | 1,511 | |
| DivPruneRetain Tokens=10%2026.02 | 1,477 | |
| VisionSelectorRetain Tokens=10%2026.02 | 1,466 | |
| FastVRetain Tokens=25%2026.02 | 1,440 | |
| HIVEVision Encoder=SigLIP, Pre-training=Hierarchical cross-attention-based2026.03 | 1,298 | |
| BaseVision Encoder=SigLIP2026.03 | 1,296 | |
| SAVision Encoder=SigLIP, Pre-training=Self-attention-based2026.03 | 1,263 | |
| DSCA2026.04 | 76.3 | |
| DualEdit2026.04 | 74.1 | |
| LiveEdit2026.04 | 73.4 | |
| MRT2026.04 | 70.9 | |
| M³FLOPs Savings=8.0×2026.03 | 63.8 | |
| DownsampleFLOPs Savings=4.0×2026.03 | 62.4 | |
| VisionZipFLOPs Savings=5.7×2026.03 | 62.1 | |
| VisionZip†FLOPs Savings=5.7×2026.03 | 61.9 | |
| HiREDFLOPs Savings=5.0×2026.03 | 61.9 | |
| LLaVA-OVFLOPs Savings=1.0×2026.03 | 60.6 | |
| VISORFLOPs Savings=8.6×2026.03 | 60.5 | |
| VisPrunerFLOPs Savings=5.7×2026.03 | 60.1 | |
| VISOR-TRFLOPs Savings=18×2026.03 | 59.5 | |
| PyramidDropFLOPs Savings=4.2×2026.03 | 59.4 | |
| SparseVLMFLOPs Savings=4.5×2026.03 | 57.2 |