Text-based Visual Question Answering on TextVQA VQAT (Accuracy)
69.74AccuracyRADIO2.5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RADIO2.5Input Resolution=single-tile2025.01 | 69.74 | — | |
| LEO2025.01 | 68.8 | — | |
| VanillaBackbone=LLaVA-Next-7B, Token Reduction Rate=0.0%2025.05 | 64.9 | — | |
| Qwen-VLLLM=Qwen-7B2026.06 | 63.8 | — | |
| VanillaBackbone=LLaVA-v1.5 13B, Token Retention Budget=576, Token Retention Ratio=100%2026.05 | 61.3 | 100 | |
| LLaVA-1.5 + PADL+ (8×)LLM=Vicuna-7B, Compression Method=PADL, Compression Ratio=8x, Adapter fine-tuning=true2026.06 | 61 | — | |
| MoB (with η-prior)Backbone=LLaVA-Next-7B, Objectives=PA VP, Pruning budget K=320, Token Reduction Rate=88.9%2025.05 | 60.2 | — | |
| OccamTokenBackbone=LLaVA-v1.5 13B, Token Retention Budget=128, Token Retention Ratio=22.2%2026.05 | 60.1 | 98.8 | |
| LLaVA-1.5 + FreePrunerLLM=Vicuna-7B, Compression Method=FreePruner2026.06 | 60 | — | |
| MustDropBackbone=LLaVA-Next-7B, Objectives=PA VP, Pruning budget K=320, Token Reduction Rate=88.9%2025.05 | 59.9 | — | |
| MoVE-KD-v1.1Input Resolution=single-tile2025.01 | 59.6 | — | |
| OccamTokenBackbone=LLaVA-v1.5 13B, Token Retention Budget=64, Token Retention Ratio=11.1%2026.05 | 59.6 | 97.9 | |
| DARTBackbone=LLaVA-Next-7B, Objectives=VP, Pruning budget K=320, Token Reduction Rate=88.9%2025.05 | 58.7 | — | |
| VisionZipBackbone=LLaVA-v1.5 13B, Token Retention Budget=128, Token Retention Ratio=22.2%2026.05 | 58.7 | 97.1 | |
| MoB (+ η-prior)Backbone=LLaVA-1.5-7B, Objectives=-, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 58.5 | — | |
| SparseVLMBackbone=LLaVA-Next-7B, Objectives=PA, Pruning budget K=320, Token Reduction Rate=88.9%2025.05 | 58.4 | — | |
| VanillaBackbone=LLaVA-1.5-7B, Token Reduction Rate=0.0%2025.05 | 58.2 | — | |
| MoB (w/o η-prior)Backbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 58.2 | — | |
| VanillaRetained Tokens=576, Base Model=LLaVA-v1.5-7B2026.04 | 58.2 | 100 | |
| LLaVA-1.5LLM=Vicuna-7B2026.06 | 58.2 | — | |
| MoB (+ η-prior)Backbone=LLaVA-1.5-7B, Objectives=-, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 57.8 | — | |
| TwigVLMRetained Tokens=128, Params.=610M, Base Model=LLaVA-v1.5-7B2026.04 | 57.8 | 99 | |
| LLaVA-1.5 + PADL (8×)LLM=Vicuna-7B, Compression Method=PADL, Compression Ratio=8x, Adapter fine-tuning=false2026.06 | 57.7 | — | |
| MoB (w/o η-prior)Backbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 57.5 | — | |
| DARTBackbone=LLaVA-1.5-7B, Objectives=VP, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 57.4 | — | |
| VisionZipBackbone=LLaVA-v1.5 13B, Token Retention Budget=64, Token Retention Ratio=11.1%2026.05 | 57.4 | 93.6 | |
| LearnPrunerRetained Tokens=128, Params.=0.53M, Base Model=LLaVA-v1.5-7B2026.04 | 57.3 | 98.5 | |
| MoB (w/o η-prior)Backbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=64, Token Reduction Rate=88.9%2025.05 | 57 | — | |
| MoB (+ η-prior)Backbone=LLaVA-1.5-7B, Objectives=-, Pruning budget K=64, Token Reduction Rate=88.9%2025.05 | 57 | — | |
| VisPrunerRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 57 | 97.3 | |
| VisionZip ‡Retained Tokens=128, Params.=20.9M, Base Model=LLaVA-v1.5-7B2026.04 | 57 | 97.3 | |
| VisionZipRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 56.8 | 96.3 | |
| LearnPrunerRetained Tokens=64, Params.=0.53M, Base Model=LLaVA-v1.5-7B2026.04 | 56.6 | 96.9 | |
| MustDropBackbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 56.5 | — | |
| FasterVLMBackbone=LLaVA-Next-7B, Objectives=VP, Pruning budget K=320, Token Reduction Rate=88.9%2025.05 | 56.5 | — | |
| DARTBackbone=LLaVA-1.5-7B, Objectives=VP, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 56.4 | — | |
| RADIOInput Resolution=single-tile2025.01 | 56.32 | — | |
| MustDropBackbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 56.3 | — | |
| DARTRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 56.3 | 95.4 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Objectives=PA, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 56.1 | — | |
| DivPruneRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 56.1 | 96.4 | |
| LearnPrunerRetained Tokens=32, Params.=0.53M, Base Model=LLaVA-v1.5-7B2026.04 | 56.1 | 94.8 | |
| VisionZip ‡Retained Tokens=64, Params.=20.9M, Base Model=LLaVA-v1.5-7B2026.04 | 56 | 95.1 | |
| VisPrunerRetained Tokens=64, Base Model=LLaVA-v1.5-7B2026.04 | 55.8 | 94.3 | |
| TwigVLMRetained Tokens=64, Params.=610M, Base Model=LLaVA-v1.5-7B2026.04 | 55.8 | 96 | |
| FastVBackbone=LLaVA-Next-7B, Objectives=VP, Pruning budget K=320, Token Reduction Rate=88.9%2025.05 | 55.7 | — | |
| LLaVA-1.5 + PruMergeLLM=Vicuna-7B, Compression Method=PruMerge2026.06 | 55.6 | — | |
| VisionZipRetained Tokens=64, Base Model=LLaVA-v1.5-7B2026.04 | 55.5 | 93 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Objectives=PA, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 54.9 | — | |
| SparseVLMRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 54.9 | 92.6 | |
| DivPruneRetained Tokens=64, Base Model=LLaVA-v1.5-7B2026.04 | 54.7 | 93.9 | |
| DARTRetained Tokens=64, Base Model=LLaVA-v1.5-7B2026.04 | 54.7 | 91.9 | |
| DARTBackbone=LLaVA-1.5-7B, Objectives=VP, Pruning budget K=64, Token Reduction Rate=88.9%2025.05 | 54.4 | — | |
| MustDropBackbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=64, Token Reduction Rate=88.9%2025.05 | 54.2 | — | |
| VisPrunerRetained Tokens=32, Base Model=LLaVA-v1.5-7B2026.04 | 53.9 | 89.7 | |
| VisionZipRetained Tokens=32, Base Model=LLaVA-v1.5-7B2026.04 | 53.1 | 87.8 | |
| DivPruneRetained Tokens=32, Base Model=LLaVA-v1.5-7B2026.04 | 52.9 | 90.5 | |
| FastVBackbone=LLaVA-1.5-7B, Objectives=VP, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 52.5 | — | |
| DARTRetained Tokens=32, Base Model=LLaVA-v1.5-7B2026.04 | 52.2 | 88 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Objectives=PA, Pruning budget K=64, Token Reduction Rate=88.9%2025.05 | 51.8 | — | |
| SparseVLMRetained Tokens=64, Base Model=LLaVA-v1.5-7B2026.04 | 51.8 | 85.6 | |
| InstructBLIPLLM=Vicuna-13B2026.06 | 50.7 | — | |
| FastVBackbone=LLaVA-1.5-7B, Objectives=VP, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 50.6 | — | |
| FastVRetained Tokens=128, Base Model=LLaVA-v1.5-7B2026.04 | 50.6 | 82.1 | |
| InstructBLIPLLM=Vicuna-7B2026.06 | 50.1 | — | |
| FastVBackbone=LLaVA-1.5-7B, Objectives=VP, Pruning budget K=64, Token Reduction Rate=88.9%2025.05 | 47.8 | — | |
| FastVRetained Tokens=64, Base Model=LLaVA-v1.5-7B2026.04 | 47.8 | 71.4 | |
| SparseVLMRetained Tokens=32, Base Model=LLaVA-v1.5-7B2026.04 | 46.1 | 77.5 | |
| FastVRetained Tokens=32, Base Model=LLaVA-v1.5-7B2026.04 | 42.5 | 58.6 | |
| IDEFICS-80BLLM=LLaMA-65B2026.06 | 30.9 | — | |
| IDEFICS-9BLLM=LLaMA-7B2026.06 | 25.9 | — |