Multimodal Understanding on VQAv2, GQA, VQAText, POPE, MME
81.2VQAv2 AccuracyLLaVA-NeXT-7B
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| LLaVA-NeXT-7BRetained Tokens=2880, Reduction Ratio=0%2026.02 | 81.2 | 62.9 | 59.6 | 86.3 | 1,513.8 | 73.1 | 100 | |
| ConsensusDropRetained Tokens=640, Reduction Ratio=77.8%2026.02 | 79.9 | 62.1 | 59.7 | 86.1 | 1,483.9 | 72.4 | 99 | |
| VisPrunerRetained Tokens=640, Reduction Ratio=77.8%2026.02 | 79.8 | 61.6 | 59.3 | 85.9 | 1,480.7 | 72.1 | 98.6 | |
| VisionZipRetained Tokens=640, Reduction Ratio=77.8%2026.02 | 79.2 | 60.1 | 58.5 | 82.2 | 1,468.4 | 70.7 | 96.7 | |
| FastVRetained Tokens=640, Reduction Ratio=77.8%2026.02 | 78.9 | 60.4 | 58.4 | 83.1 | 1,477.3 | 70.9 | 97 | |
| SparseVLMRetained Tokens=640, Reduction Ratio=77.8%2026.02 | 78.2 | 59.1 | 56.2 | 80.9 | 1,456.3 | 69.4 | 94.9 | |
| ConsensusDropRetained Tokens=320, Reduction Ratio=88.9%2026.02 | 76.1 | 59.1 | 58 | 81.5 | 1,372.8 | 68.7 | 93.9 | |
| VisPrunerRetained Tokens=320, Reduction Ratio=88.9%2026.02 | 75.7 | 58.4 | 57.6 | 80.4 | 1,370.1 | 68.1 | 93.2 | |
| VisionZipRetained Tokens=320, Reduction Ratio=88.9%2026.02 | 74.2 | 58.1 | 55.3 | 75 | 1,348.8 | 66 | 90.3 | |
| FastVRetained Tokens=320, Reduction Ratio=88.9%2026.02 | 71.9 | 55.9 | 55.7 | 71.7 | 1,282.9 | 63.9 | 87.4 | |
| SparseVLMRetained Tokens=320, Reduction Ratio=88.9%2026.02 | 71.4 | 56.5 | 52.4 | 73.5 | 1,342.7 | 64.2 | 87.8 | |
| ConsensusDropRetained Tokens=160, Reduction Ratio=94.4%2026.02 | 71 | 55.3 | 57.2 | 73.2 | 1,232.1 | 63.7 | 87.1 | |
| VisPrunerRetained Tokens=160, Reduction Ratio=94.4%2026.02 | 70.6 | 54.7 | 56 | 72.9 | 1,226 | 63.1 | 86.3 | |
| VisionZipRetained Tokens=160, Reduction Ratio=94.4%2026.02 | 67.3 | 54.3 | 54.7 | 59.4 | 1,239.7 | 59.5 | 81.4 | |
| SparseVLMRetained Tokens=160, Reduction Ratio=94.4%2026.02 | 62.2 | 50.2 | 45.1 | 54.6 | 1,167.1 | 54.1 | 74 | |
| FastVRetained Tokens=160, Reduction Ratio=94.4%2026.02 | 61.8 | 49.8 | 51.9 | 51.7 | 1,079.5 | 53.8 | 73.6 |