Vision-Language Understanding on SEED-Bench Image
100Average AccuracyVanilla
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VanillaRetained Tokens=576, Token Reduction Ratio=100%2026.03 | 100 | 69.7 | — | |
| PRUNESIDRetained Tokens=192, Token Reduction Ratio=↓ 66.7%2026.03 | 98.7 | 67.8 | — | |
| VisionZipRetained Tokens=192, Token Reduction Ratio=↓ 66.7%2026.03 | 98.3 | 67.5 | — | |
| PRUNESIDRetained Tokens=128, Token Reduction Ratio=↓ 77.8%2026.03 | 97.4 | 66.5 | — | |
| VisionZipRetained Tokens=128, Token Reduction Ratio=↓ 77.8%2026.03 | 96.2 | 65.6 | — | |
| PRUNESIDRetained Tokens=64, Token Reduction Ratio=↓ 88.9%2026.03 | 94.4 | 63.6 | — | |
| VisionZipRetained Tokens=64, Token Reduction Ratio=↓ 88.9%2026.03 | 92.4 | 61.7 | — | |
| OriginalPrecision (Pre.)=FP16, Keep Ratio=100%, GFLOPs=100.00%2026.04 | 77.53 | — | 100 | |
| Quant.Precision (Pre.)=W4A4, Keep Ratio=100%, GFLOPs=100.00%2026.04 | 75.94 | — | 97.95 | |
| QUOTAPrecision (Pre.)=W4A4, Keep Ratio=30%, GFLOPs=55.80%2026.04 | 75.19 | — | 96.98 | |
| PruningPrecision (Pre.)=FP16, Keep Ratio=30%, GFLOPs=55.80%2026.04 | 74.76 | — | 96.43 |