OCR-based Visual Question Answering on TextVQA
61.2VQATextLLaVA-1.5-13B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLaVA-1.5-13BBackbone=LLaVA-1.5-13B, Visual Token Retention=576 tokens2026.06 | 61.2 | 100 | |
| SparseVLMBackbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 59.1 | 97.9 | |
| DARTBackbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 59 | 97.1 | |
| SPAREBackbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 58.6 | 98 | |
| CDPrunerBackbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 58.4 | 97.9 | |
| SPAREBackbone=LLaVA-1.5-13B, Visual Token Retention=64 tokens2026.06 | 58.1 | 97.2 | |
| CDPrunerBackbone=LLaVA-1.5-13B, Visual Token Retention=64 tokens2026.06 | 57.6 | 96.3 | |
| PruMerge+Backbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 56.6 | 93.2 | |
| SPAREBackbone=LLaVA-1.5-13B, Visual Token Retention=32 tokens2026.06 | 56.3 | 94.7 | |
| SparseVLMBackbone=LLaVA-1.5-13B, Visual Token Retention=64 tokens2026.06 | 55.8 | 89.7 | |
| DARTBackbone=LLaVA-1.5-13B, Visual Token Retention=64 tokens2026.06 | 55.8 | 92.5 | |
| PruMerge+Backbone=LLaVA-1.5-13B, Visual Token Retention=64 tokens2026.06 | 55.7 | 90 | |
| CDPrunerBackbone=LLaVA-1.5-13B, Visual Token Retention=32 tokens2026.06 | 55.2 | 92.6 | |
| DARTBackbone=LLaVA-1.5-13B, Visual Token Retention=32 tokens2026.06 | 52.7 | 86 |