Visual Question Answering on VizWiz (test)
73.3AccuracyPaLI-17B
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| PaLI-17BVocabulary setting=Open-vocabulary generation2022.09 | 73.3 | — | — | — | — | — | — | — | — | |
| Qwen-VL-Max + AutoVBase Model=Qwen-VL-Max, AutoV Integration=true, Retrieval Strategy Source=AutoV pre-trained on LLaVA-OneVision2025.06 | 71.9 | — | — | — | — | — | — | — | — | |
| GIT2Parameters=5.1B, Vocabulary setting=Closed-vocabulary classification2022.09 | 70.1 | — | — | — | — | — | — | — | — | |
| VanillaBackbone=InternVL3-38B, ViT token retention rate=100%, LLM token retention rate=100%2025.12 | 69.3 | — | — | — | — | — | 100 | — | — | |
| HiPruneBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=33.3%2025.08 | 68.4 | — | — | — | — | — | — | — | 98.7 | |
| QwenBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=100%2025.08 | 68.3 | — | — | — | — | — | — | — | 100 | |
| HiPrune++Backbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=33.3%2025.08 | 68 | — | — | — | — | — | — | — | 98.7 | |
| IPCV+FastVBackbone=InternVL3-38B, ViT token retention rate=40%, LLM token retention rate=40%2025.12 | 67.9 | — | — | — | — | — | 64.4 | — | — | |
| ToFuBackbone=InternVL3-38B, ViT token retention rate=40%, LLM token retention rate=40%2025.12 | 67.7 | — | — | — | — | — | 61.9 | — | — | |
| GITParameters=0.7B, Vocabulary setting=Closed-vocabulary classification2022.09 | 67.5 | — | — | — | — | — | — | — | — | |
| ToMeBackbone=InternVL3-38B, ViT token retention rate=40%, LLM token retention rate=40%2025.12 | 67.4 | — | — | — | — | — | 61.7 | — | — | |
| DART (ViT)Backbone=InternVL3-38B, ViT token retention rate=40%, LLM token retention rate=40%2025.12 | 67.2 | — | — | — | — | — | 63.9 | — | — | |
| VisionZipBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=33.3%2025.08 | 67.1 | — | — | — | — | — | — | — | 97.7 | |
| HiPruneBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=22.2%2025.08 | 67.1 | — | — | — | — | — | — | — | 97.1 | |
| FastVBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=33.3%2025.08 | 66.9 | — | — | — | — | — | — | — | 97.4 | |
| HiPrune++Backbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=22.2%2025.08 | 66.7 | — | — | — | — | — | — | — | 97.1 | |
| VisionZipBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=22.2%2025.08 | 66.3 | — | — | — | — | — | — | — | 96.2 | |
| FastVBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=22.2%2025.08 | 66.2 | — | — | — | — | — | — | — | 95.9 | |
| FastVBackbone=InternVL3-38B, ViT token retention rate=100%, LLM token retention rate=5%2025.12 | 65.9 | — | — | — | — | — | 70.7 | — | — | |
| FlamingoParameters=80B, Vocabulary setting=Open-vocabulary generation2022.09 | 65.4 | — | — | — | — | — | — | — | — | |
| QwenToken Retention Rate=100%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 64.8 | — | — | — | — | — | — | — | — | |
| VisionZipToken Retention Rate=22.2%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 64.7 | — | — | — | — | — | — | — | — | |
| Qwen-VL-MaxBase Model=Qwen-VL-Max, AutoV Integration=false2025.06 | 64.6 | — | — | — | — | — | — | — | — | |
| HiPruneBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=11.1%2025.08 | 64.6 | — | — | — | — | — | — | — | 93 | |
| HiPrune++Backbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=11.1%2025.08 | 64.5 | — | — | — | — | — | — | — | 93 | |
| HiPruneToken Retention Rate=22.2%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 64.2 | — | — | — | — | — | — | — | — | |
| HiPrune++Token Retention Rate=22.2%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 64.2 | — | — | — | — | — | — | — | — | |
| FastVBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=11.1%2025.08 | 63.8 | — | — | — | — | — | — | — | 86.4 | |
| FastVToken Retention Rate=22.2%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 63.5 | — | — | — | — | — | — | — | — | |
| HiPruneToken Retention Rate=11.1%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 63 | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=11.1%2025.08 | 62.8 | — | — | — | — | — | — | — | 91.5 | |
| VisionZipToken Retention Rate=11.1%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 62.6 | — | — | — | — | — | — | — | — | |
| SparseVLMBackbone=InternVL3-38B, ViT token retention rate=100%, LLM token retention rate=5%2025.12 | 62.5 | — | — | — | — | — | 73.4 | — | — | |
| HiPrune++Token Retention Rate=11.1%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 62.5 | — | — | — | — | — | — | — | — | |
| FastVToken Retention Rate=11.1%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 61.9 | — | — | — | — | — | — | — | — | |
| GPT-4o + AutoVBase Model=GPT-4o, AutoV Integration=true, Retrieval Strategy Source=AutoV pre-trained on LLaVA-OneVision2025.06 | 61.8 | — | — | — | — | — | — | — | — | |
| QuEPTBits=W4A82026.02 | 61.3 | — | — | — | — | — | — | — | — | |
| HiPruneToken Retention Rate=5.6%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 61.1 | — | — | — | — | — | — | — | — | |
| VisionZipToken Retention Rate=5.6%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 60.9 | — | — | — | — | — | — | — | — | |
| HiPrune++Token Retention Rate=5.6%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 60.8 | — | — | — | — | — | — | — | — | |
| MBQBits=W32026.02 | 60.7 | — | — | — | — | — | — | — | — | |
| FP16 (Baseline)Bits=FP162026.02 | 60.4 | — | — | — | — | — | — | — | — | |
| QuEPTBits=W32026.02 | 60.3 | — | — | — | — | — | — | — | — | |
| DARTBackbone=InternVL3-38B, ViT token retention rate=100%, LLM token retention rate=5%2025.12 | 60.1 | — | — | — | — | — | 71.5 | — | — | |
| FastVToken Retention Rate=5.6%, Base Model=Qwen2.5-VL-32B-Instruct2025.08 | 60.1 | — | — | — | — | — | — | — | — | |
| QuEPTBits=W4A42026.02 | 59.8 | — | — | — | — | — | — | — | — | |
| MBQBits=W4A82026.02 | 58.9 | — | — | — | — | — | — | — | — | |
| ShareGPT4V-7BLanguage Model=Vicuna-7B2023.11 | 57.2 | — | — | — | — | — | — | — | — | |
| SmoothQBits=W4A82026.02 | 56.7 | — | — | — | — | — | — | — | — | |
| AWQBits=W32026.02 | 56.4 | — | — | — | — | — | — | — | — | |
| ALVTSTokens Retained=64, Reduction Ratio=89%2026.06 | 55.65 | — | — | — | — | — | — | — | — | |
| Gemini-1.5-Pro + AutoVBase Model=Gemini-1.5-Pro, AutoV Integration=true, Retrieval Strategy Source=AutoV pre-trained on LLaVA-OneVision2025.06 | 55.5 | — | — | — | — | — | — | — | — | |
| DARTTokens Retained=64, Reduction Ratio=89%2026.06 | 55.46 | — | — | — | — | — | — | — | — | |
| DARTTokens Retained=128, Reduction Ratio=78%2026.06 | 55.28 | — | — | — | — | — | — | — | — | |
| QuEPTBits=W22026.02 | 55.2 | — | — | — | — | — | — | — | — | |
| FastVTokens Retained=128, Reduction Ratio=78%2026.06 | 55.14 | — | — | — | — | — | — | — | — | |
| ALVTSTokens Retained=192, Reduction Ratio=67%2026.06 | 55.05 | — | — | — | — | — | — | — | — | |
| FastVTokens Retained=192, Reduction Ratio=67%2026.06 | 54.95 | — | — | — | — | — | — | — | — | |
| DARTTokens Retained=192, Reduction Ratio=67%2026.06 | 54.95 | — | — | — | — | — | — | — | — | |
| FastVTokens Retained=64, Reduction Ratio=89%2026.06 | 54.91 | — | — | — | — | — | — | — | — | |
| ALVTSTokens Retained=128, Reduction Ratio=78%2026.06 | 54.9 | — | — | — | — | — | — | — | — | |
| Pythia v0.3description=Revised implementation of Pythia2019.04 | 54.72 | — | — | — | — | — | — | — | — | |
| DivPruneBackbone=LLaVA-1.5-13B, Token Budget=32 Tokens2026.06 | 54.5 | — | — | — | — | — | — | — | — | |
| PDropTokens Retained=192, Reduction Ratio=67%2026.06 | 54.42 | — | — | — | — | — | — | — | — | |
| DivPruneBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 54.4 | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-7BTokens Retained=576, Retention Ratio=100%2026.06 | 54.32 | — | — | — | — | — | — | — | — | |
| AgilePruneBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 54.2 | — | — | — | — | — | — | — | — | |
| STSBackbone=LLaVA-1.5-13B, Token Budget=32 Tokens2026.06 | 53.9 | — | — | — | — | — | — | — | — | |
| LLaVA-1.5Language Model=Vicuna-13B2023.11 | 53.6 | — | — | — | — | — | — | — | — | |
| VanillaBackbone=LLaVA-1.5-13B, Token Budget=Full Tokens2026.06 | 53.6 | — | — | — | — | — | — | — | — | |
| DivPruneBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 53.5 | — | — | — | — | — | — | — | — | |
| V^2DropBackbone=InternVL3-38B, ViT token retention rate=100%, LLM token retention rate=5%2025.12 | 53.4 | — | — | — | — | — | 70.5 | — | — | |
| DARTBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 53.4 | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 53.2 | — | — | — | — | — | — | — | — | |
| DARTBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 53 | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=LLaVA-1.5-13B, Token Budget=32 Tokens2026.06 | 53 | — | — | — | — | — | — | — | — | |
| GPT-4oBase Model=GPT-4o, AutoV Integration=false2025.06 | 52.8 | — | — | — | — | — | — | — | — | |
| STSBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 52.8 | — | — | — | — | — | — | — | — | |
| STSBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 52.8 | — | — | — | — | — | — | — | — | |
| AgilePruneBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 52.5 | — | — | — | — | — | — | — | — | |
| PDropTokens Retained=128, Reduction Ratio=78%2026.06 | 52.35 | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 52.3 | — | — | — | — | — | — | — | — | |
| DARTBackbone=LLaVA-1.5-13B, Token Budget=32 Tokens2026.06 | 52 | — | — | — | — | — | — | — | — | |
| PDropTokens Retained=64, Reduction Ratio=89%2026.06 | 51.56 | — | — | — | — | — | — | — | — | |
| BAN2019.04 | 51.4 | — | — | — | — | — | — | — | — | |
| VTWTokens Retained=128, Reduction Ratio=78%2026.06 | 50.76 | — | — | — | — | — | — | — | — | |
| VTWTokens Retained=192, Reduction Ratio=67%2026.06 | 50.66 | — | — | — | — | — | — | — | — | |
| VTWTokens Retained=64, Reduction Ratio=89%2026.06 | 50.34 | — | — | — | — | — | — | — | — | |
| DREAMLLM-7B*Shots (k)=4, Capability=Comprehension & Creation, Training Data=LLaVA-1.5 SFT2023.09 | 50.3 | — | — | — | — | — | — | — | — | |
| LLaVA-1.5Language Model=Vicuna-7B2023.11 | 50 | — | — | — | — | — | — | — | — | |
| FlamingoStatus=Unified SOTA2022.06 | 49.8 | — | — | — | — | — | — | — | — | |
| DREAMLLM-7B*Shots (k)=2, Capability=Comprehension & Creation, Training Data=LLaVA-1.5 SFT2023.09 | 49.8 | — | — | — | — | — | — | — | — | |
| DREAMLLM-7B*Shots (k)=8, Capability=Comprehension & Creation, Training Data=LLaVA-1.5 SFT2023.09 | 49.7 | — | — | — | — | — | — | — | — | |
| DREAMLLM-7BShots (k)=8, Capability=Comprehension & Creation2023.09 | 46.8 | — | — | — | — | — | — | — | — | |
| DREAMLLM-7BShots (k)=4, Capability=Comprehension & Creation2023.09 | 46.7 | — | — | — | — | — | — | — | — | |
| DREAMLLM-7BShots (k)=2, Capability=Comprehension & Creation2023.09 | 46.1 | — | — | — | — | — | — | — | — | |
| Gemini-1.5-ProBase Model=Gemini-1.5-Pro, AutoV Integration=false2025.06 | 45.9 | — | — | — | — | — | — | — | — | |
| UNIFIED-IO XLModel Size=XL2022.06 | 45.2 | — | — | — | — | — | — | — | — | |
| Emu-14BShots (k)=8, Capability=Comprehension & Creation, Sample selection=RICES2023.09 | 43.9 | — | — | — | — | — | — | — | — | |
| OptMerge2025.05 | 43.52 | — | — | — | — | — | — | — | — |