Multimodal Understanding on VQAv2, GQA, VQAText, MMB, and MMVet
81.2VQAv2 AccuracyLLaVA-NeXT-7B
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| LLaVA-NeXT-7BFLOPs=20.825, Retained Tokens=Vanilla2026.03 | 81.2 | 62.9 | 59.6 | 65.8 | 40 | 100 | |
| ASAPFLOPs=6.258, Retained Tokens=9602026.03 | 81.19 | 62.29 | 59.67 | 66.41 | 40.1 | 100.06 | |
| FastVFLOPs=6.477, Retained Tokens=9602026.03 | 80.33 | 61.98 | 59.32 | 65.12 | 39.4 | 98.89 | |
| VisPrunerFLOPs=6.458, Retained Tokens=9602026.03 | 80 | 62.2 | 58.81 | 65.29 | 38.4 | 98.26 | |
| ASAPFLOPs=4.144, Retained Tokens=6402026.03 | 79.91 | 61.17 | 58.98 | 65.35 | 40.48 | 99.02 | |
| VisPrunerFLOPs=4.252, Retained Tokens=6402026.03 | 79.82 | 61.22 | 58.34 | 65.29 | 36.3 | 96.7 | |
| FastVFLOPs=4.260, Retained Tokens=6402026.03 | 77.81 | 61.04 | 58.08 | 64.37 | 37.6 | 96.43 |