Visual Question Answering on VQA^T
81.57AccuracyVanilla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VanillaBackbone=Qwen3-VL-4B, Retention Ratio=100%2026.04 | 81.57 | 100 | |
| FastV w/ DSTPBackbone=Qwen3-VL-4B, Retention Ratio=33.3%2026.04 | 77.95 | 97.5 | |
| VisionZip w/ DSTPBackbone=Qwen3-VL-4B, Retention Ratio=33.3%2026.04 | 77.2 | 97.4 | |
| VisionZipBackbone=Qwen3-VL-4B, Retention Ratio=33.3%2026.04 | 77.1 | 96.5 | |
| FastVBackbone=Qwen3-VL-4B, Retention Ratio=33.3%2026.04 | 74.82 | 94.3 | |
| DivPrune w/ DSTPBackbone=Qwen3-VL-4B, Retention Ratio=33.3%2026.04 | 74.11 | 95.5 | |
| Qwen-2.5-VL-7BSpeedup=1.00×, Token Budget=Dynamic Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 72.3 | — | |
| DUET-VLM (C)Speedup=1.3x, Token Budget=Avg 640 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 71.5 | — | |
| DivPruneBackbone=Qwen3-VL-4B, Retention Ratio=33.3%2026.04 | 71.36 | 91.2 | |
| DUET-VLM (C)Speedup=1.4x, Token Budget=Avg 320 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 71.3 | — | |
| VisionZipSpeedup=1.3x, Token Budget=Avg 640 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 71.2 | — | |
| VisionZipSpeedup=1.4x, Token Budget=Avg 320 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 69.4 | — | |
| DUET-VLM (C)Speedup=1.5x, Token Budget=Avg 160 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 67.7 | — | |
| TaiChiLLM=Qwen2.5-14B, Resolution=336, Zero-shot evaluation=true2026.02 | 65.1 | — | |
| VisionZipSpeedup=1.5x, Token Budget=Avg 160 Tokens, Backbone=Qwen-2.5-VL-7B2026.02 | 64.6 | — | |
| LLaVA-1.5LLM=Vicuna-13B, Resolution=336, Zero-shot evaluation=true2026.02 | 61.3 | — | |
| LLaVA-1.5-13BImg/s=2.22, Speedup=-2025.10 | 61.2 | — | |
| APTBase Model=LLaVA-1.5-13B, Img/s=2.72, Speedup=+23%2025.10 | 59.5 | — | |
| TaiChiLLM=Gemma-2B, Resolution=336, Zero-shot evaluation=true2026.02 | 59.2 | — | |
| ResizingBase Model=LLaVA-1.5-13B, Img/s=2.72, Speedup=+23%2025.10 | 59.1 | — | |
| LLaVA-1.5-7BImg/s=3.70, Speedup=-2025.10 | 58.2 | — | |
| APTBase Model=LLaVA-1.5-7B, Img/s=4.51, Speedup=+22%2025.10 | 56.9 | — | |
| ResizingBase Model=LLaVA-1.5-7B, Img/s=4.51, Speedup=+22%2025.10 | 56.5 | — | |
| RandomBase Model=LLaVA-1.5-13B, Img/s=2.79, Speedup=+26%2025.10 | 55.7 | — | |
| RandomBase Model=LLaVA-1.5-7B, Img/s=4.58, Speedup=+24%2025.10 | 54.1 | — | |
| InstructBLIPLLM=Vicuna-13B, Resolution=224, Zero-shot evaluation=true2026.02 | 50.7 | — | |
| InstructBLIPLLM=Vicuna-7B, Resolution=224, Zero-shot evaluation=true2026.02 | 50.1 | — | |
| MobileVLMLLM=MLLaMA 2.7B, Resolution=336, Zero-shot evaluation=true2026.02 | 47.5 | — | |
| BLIP-2LLM=Vicuna-13B, Resolution=224, Zero-shot evaluation=true2026.02 | 42.5 | — |