Multi-modal Understanding on SEED-ALL
61.6AccuracyLLaVA-1.5 Vanilla 13B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLaVA-1.5 Vanilla 13BTokens Retained=576, Compression Ratio=100%2025.08 | 61.6 | 100 | |
| VisionZipTokens Retained=192, Compression Ratio=↓ 66.7%2025.08 | 61.2 | 99.4 | |
| MMTokTokens Retained=192, Compression Ratio=↓ 66.7%2025.08 | 61.17 | 99.3 | |
| DivPruneTokens Retained=192, Compression Ratio=↓ 66.7%2025.08 | 60.83 | 98.8 | |
| MMTokTokens Retained=128, Compression Ratio=↓ 77.8%2025.08 | 60.11 | 97.6 | |
| VisionZipTokens Retained=128, Compression Ratio=↓ 77.8%2025.08 | 59.74 | 97 | |
| MMTokTokens Retained=64, Compression Ratio=↓ 88.9%2025.08 | 59.51 | 96.6 | |
| DivPruneTokens Retained=128, Compression Ratio=↓ 77.8%2025.08 | 59.49 | 96.6 | |
| DivPruneTokens Retained=64, Compression Ratio=↓ 88.9%2025.08 | 57.7 | 93.7 | |
| VisionZipTokens Retained=64, Compression Ratio=↓ 88.9%2025.08 | 57.13 | 92.7 |