Multimodal Understanding on MMMU (Accuracy, Relative Performance)
38AccuracyVisionZip ‡
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VisionZip ‡Retained Tokens=320, Fine-tuning=true2024.12 | 38 | 108.3 | |
| VisionZip ‡Retained Tokens=160, Fine-tuning=true2024.12 | 37.7 | 107.4 | |
| VisionZip ‡Retained Tokens=640, Fine-tuning=true2024.12 | 37.2 | 106 | |
| MMTokTokens Retained=192, Compression Ratio=↓ 66.7%2025.08 | 36.78 | 101 | |
| DivPruneTokens Retained=192, Compression Ratio=↓ 66.7%2025.08 | 36.56 | 100.4 | |
| LLaVA-1.5 Vanilla 13BTokens Retained=576, Compression Ratio=100%2025.08 | 36.4 | 100 | |
| VisionZipTokens Retained=192, Compression Ratio=↓ 66.7%2025.08 | 36.4 | 100 | |
| VisionZip 🔥Tokens Retained=192, Compression Ratio=↓ 66.7%2025.08 | 36.4 | 100 | |
| VisionZipTokens Retained=64, Compression Ratio=↓ 88.9%2025.08 | 36.4 | 100 | |
| VisionZipRetained Tokens=160, Fine-tuning=false2024.12 | 36.1 | 102.8 | |
| VisionZipTokens Retained=128, Compression Ratio=↓ 77.8%2025.08 | 36.1 | 99.2 | |
| DivPruneTokens Retained=128, Compression Ratio=↓ 77.8%2025.08 | 35.56 | 97.7 | |
| MMTokTokens Retained=128, Compression Ratio=↓ 77.8%2025.08 | 35.44 | 97.4 | |
| VisionZip 🔥Tokens Retained=128, Compression Ratio=↓ 77.8%2025.08 | 35.4 | 97.3 | |
| VisionZipRetained Tokens=320, Fine-tuning=false2024.12 | 35.3 | 100.5 | |
| VisionZip 🔥Tokens Retained=64, Compression Ratio=↓ 88.9%2025.08 | 35.3 | 97 | |
| DivPruneTokens Retained=64, Compression Ratio=↓ 88.9%2025.08 | 35.22 | 96.8 | |
| MMTokTokens Retained=64, Compression Ratio=↓ 88.9%2025.08 | 35.22 | 96.8 | |
| VanillaRetained Tokens=2880, Fine-tuning=false2024.12 | 35.1 | 100 | |
| VisionZipRetained Tokens=640, Fine-tuning=false2024.12 | 34.7 | 98.9 |