Visual Question Answering on TextVQA (VQAText, Normalized Average Retention)
64.9VQAText ScoreVanilla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VanillaBase Model=LLaVA-NEXT-7B, Token Budget=2880, Pruning Rate=0%, Loc. (Pruning Location)=-2026.05 | 64.9 | 100 | |
| Qwen-VLLLM=Qwen-7B, Resolution=4482026.07 | 63.8 | — | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution=4482026.07 | 61.5 | — | |
| VanillaModel=LLaVA-NeXT, TFLOPs=100%2026.06 | 61.36 | 100 | |
| Ours (N=20)Model=LLaVA-NeXT, TFLOPs=67%2026.06 | 60.65 | 98.8 | |
| APETModel=LLaVA-NeXT, TFLOPs=70%2026.06 | 59.98 | 99.4 | |
| V2DropModel=LLaVA-NeXT, TFLOPs=70%2026.06 | 59.83 | 98.4 | |
| VSkip+ (N=20)Model=LLaVA-NeXT, TFLOPs=74%2026.06 | 59.74 | 98.2 | |
| HiREDBase Model=LLaVA-NEXT-7B, Token Budget=320, Pruning Rate=88.9%, Loc. (Pruning Location)=Pre2026.05 | 58.8 | 93.4 | |
| DARTBase Model=LLaVA-NEXT-7B, Token Budget=320, Pruning Rate=88.9%, Loc. (Pruning Location)=L22026.05 | 58.7 | 95.6 | |
| HoloVBase Model=LLaVA-NEXT-7B, Token Budget=320, Pruning Rate=88.9%, Loc. (Pruning Location)=Pre2026.05 | 58.7 | 95.7 | |
| LLaVA-SPLLM=Vicuna-7B, Resolution=3362026.07 | 58.5 | — | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution=3362026.07 | 58.2 | — | |
| DiffPruneBase Model=LLaVA-NEXT-7B, Token Budget=320, Pruning Rate=88.9%, Loc. (Pruning Location)=Pre2026.05 | 56.7 | 96.1 | |
| ShortV (N=20)Model=LLaVA-NeXT, TFLOPs=51%2026.06 | 56.5 | 96 | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution=3362026.07 | 56.2 | — | |
| FastVBase Model=LLaVA-NEXT-7B, Token Budget=320, Pruning Rate=88.9%, Loc. (Pruning Location)=L2–L322026.05 | 55.7 | 87.6 | |
| TrustLLaVALLM=Vicuna-7B, Resolution=3362026.07 | 55 | — | |
| PDropBase Model=LLaVA-NEXT-7B, Token Budget=320, Pruning Rate=88.9%, Loc. (Pruning Location)=L8–L242026.05 | 54.4 | 90.7 | |
| TrustLLaVA (MLP)LLM=Vicuna-7B, Resolution=3362026.07 | 51.1 | — | |
| VTW (K=16)Model=LLaVA-NeXT, TFLOPs=51%2026.06 | 47.71 | 86.5 |