Visual Question Answering on Text on TextVQA
58.21AccuracyOriginal
Evaluation Results
| Method | Links | |
|---|---|---|
| OriginalBackbone=LLaVA-1.5-7B, Token Budget=Full2026.05 | 58.21 | |
| GRIP+decoder+slBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=sl, Pruning Component=decoder2026.05 | 57.86 | |
| GRIP+decoder+rlBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=rl, Pruning Component=decoder2026.05 | 57.79 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 57.75 | |
| GRIP+encoder+slBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=sl, Pruning Component=encoder2026.05 | 57.65 | |
| GRIP+encoder+rlBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=rl, Pruning Component=encoder2026.05 | 57.6 | |
| VisprunerBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 57.45 | |
| VisionZipBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 57.33 | |
| GRIP+decoder+rlBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=rl, Pruning Component=decoder2026.05 | 57.17 | |
| GRIP+encoder+slBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=sl, Pruning Component=encoder2026.05 | 57 | |
| GRIP+encoder+rlBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=rl, Pruning Component=encoder2026.05 | 56.93 | |
| DARTBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 56.9 | |
| GRIP+decoder+slBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=sl, Pruning Component=decoder2026.05 | 56.87 | |
| VisionZipBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 56.83 | |
| VisprunerBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 56.8 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 56.71 | |
| DivPruneBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 56.61 | |
| DivPruneBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 55.89 | |
| DARTBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 55.85 | |
| VisprunerBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 55.72 | |
| VisionZipBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 55.49 | |
| PruneSIDBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 55.07 | |
| GRIP+decoder+rlBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=rl, Pruning Component=decoder2026.05 | 54.99 | |
| GRIP+encoder+rlBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=rl, Pruning Component=encoder2026.05 | 54.79 | |
| PruneSIDBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 54.67 | |
| DivPruneBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 54.61 | |
| GRIP+encoder+slBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=sl, Pruning Component=encoder2026.05 | 54.54 | |
| GRIP+decoder+slBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=sl, Pruning Component=decoder2026.05 | 54.51 | |
| PruneSIDBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 54.45 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 53.44 | |
| DARTBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 50.39 | |
| Qwen2.5-VL 7B, DenseBackbone=Qwen2.5-VL 7B, Sparsity=Dense2026.03 | 0.8293 | |
| ATV-PruningBackbone=Qwen2.5-VL 7B, Sparsity=60% Sparsity2026.03 | 0.7807 | |
| TAMPBackbone=Qwen2.5-VL 7B, Sparsity=60% Sparsity2026.03 | 0.7796 | |
| SparseGPTBackbone=Qwen2.5-VL 7B, Sparsity=60% Sparsity2026.03 | 0.7663 | |
| LLaVA-OneVision 7B, DenseBackbone=LLaVA-OneVision 7B, Sparsity=Dense2026.03 | 0.7605 | |
| WandaBackbone=Qwen2.5-VL 7B, Sparsity=60% Sparsity2026.03 | 0.756 | |
| SparseGPTBackbone=LLaVA-OneVision 7B, Sparsity=60% Sparsity2026.03 | 0.7262 | |
| ATV-PruningBackbone=LLaVA-OneVision 7B, Sparsity=60% Sparsity2026.03 | 0.7023 | |
| WandaBackbone=LLaVA-OneVision 7B, Sparsity=60% Sparsity2026.03 | 0.6964 | |
| TAMPBackbone=LLaVA-OneVision 7B, Sparsity=60% Sparsity2026.03 | 0.6964 |