Visual Question Answering on VizWiz
100AccuracyVanilla
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| VanillaBackbone=LLaVA-1.5-7B, Retained Tokens=5762026.04 | 100 | — | — | — | 50 | 100 | |
| RCPBackbone=LLaVA-1.5-7B, Retained Tokens=1922026.04 | 99.06 | — | — | — | 50.39 | 100.78 | |
| VisionZipBackbone=LLaVA-1.5-7B, Retained Tokens=1922026.04 | 98.75 | — | — | — | 51.6 | 103.2 | |
| DARTBackbone=LLaVA-1.5-7B, Retained Tokens=1922026.04 | 98.57 | — | — | — | 51.1 | 102.2 | |
| PDropBackbone=LLaVA-1.5-7B, Retained Tokens=1922026.04 | 97.07 | — | — | — | 51.1 | 102.2 | |
| RCPBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.04 | 96.73 | — | — | — | 50.1 | 100.2 | |
| HiREDBackbone=LLaVA-1.5-7B, Retained Tokens=1922026.04 | 96.53 | — | — | — | 50.1 | 100.2 | |
| HiREDBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.04 | 95.2 | — | — | — | 51.3 | 102.6 | |
| PDropBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.04 | 95.08 | — | — | — | 51 | 102 | |
| RCPBackbone=LLaVA-1.5-7B, Retained Tokens=642026.04 | 95 | — | — | — | 49.94 | 99.88 | |
| VisionZipBackbone=LLaVA-1.5-7B, Retained Tokens=642026.04 | 94.81 | — | — | — | 52.9 | 105.8 | |
| DARTBackbone=LLaVA-1.5-7B, Retained Tokens=642026.04 | 94.4 | — | — | — | 51.6 | 103.2 | |
| HiREDBackbone=LLaVA-1.5-7B, Retained Tokens=642026.04 | 91.46 | — | — | — | 50.2 | 100.4 | |
| FastVBackbone=LLaVA-1.5-7B, Retained Tokens=1922026.04 | 88.71 | — | — | — | 50.8 | 101.6 | |
| CoGR-MoEBackbone=LLaVA-1.5-7B2026.04 | 84.8 | — | — | — | — | — | |
| FastVBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.04 | 82.86 | — | — | — | 51.3 | 102.6 | |
| ToMeBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.04 | 82.75 | — | — | — | 50.5 | 101 | |
| I2MoEBackbone=LLaVA-1.5-7B2026.04 | 82.4 | — | — | — | — | — | |
| AdaMergingBackbone=LLaVA, Adapter Rank=16, Optimization Strategy=gradient-based2026.03 | 81 | — | — | — | — | — | |
| MoMEBackbone=LLaVA-1.5-7B2026.04 | 81 | — | — | — | — | — | |
| CL-MOEBackbone=LLaVA-1.5-7B2026.04 | 80.9 | — | — | — | — | — | |
| TARA-Variant BBackbone=LLaVA, Adapter Rank=16, Optimization Strategy=gradient-based2026.03 | 79.2 | — | — | — | — | — | |
| Qwen-VLLLM=Qwen-7B, Resolution (Res.)=448, #Token=256, Pre-training Data (PT)=1.4B, Instruction-tuning Data (IT)=50M, Zero-shot evaluation protocol=true2024.07 | 78.8 | — | — | — | — | — | |
| TARA-Variant ABackbone=LLaVA, Adapter Rank=16, Optimization Strategy=gradient-based2026.03 | 78.7 | — | — | — | — | — | |
| Metis-HOMEBackbone=LLaVA-1.5-7B2026.04 | 78.5 | — | — | — | — | — | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution (Res.)=448, #Token=256, Pre-training Data (PT)=1.4B, Instruction-tuning Data (IT)=50M, Zero-shot evaluation protocol=true2024.07 | 78.2 | — | — | — | — | — | |
| KnOTS-TIESBackbone=LLaVA, Adapter Rank=16, Optimization Strategy=gradient-free2026.03 | 77 | — | — | — | — | — | |
| MH-MoEBackbone=LLaVA-1.5-7B2026.04 | 77 | — | — | — | — | — | |
| FP16Model=Qwen2-VL-72B, Bitwidth=FP162024.12 | 76 | — | — | — | 78.1 | — | |
| PDropBackbone=LLaVA-1.5-7B, Retained Tokens=642026.04 | 75.89 | — | — | — | 50.7 | 101.4 | |
| DualPDBackbone=Qwen-2.5-VL-7B, Decoding Strategy=DualPD2026.01 | 75.8 | — | — | — | — | — | |
| MBQModel=Qwen2-VL-72B, Bitwidth=W3A162024.12 | 75.6 | — | — | — | 77.6 | — | |
| AWQModel=Qwen2-VL-72B, Bitwidth=W3A162024.12 | 75.4 | — | — | — | 77.5 | — | |
| RTNModel=Qwen2-VL-72B, Bitwidth=W3A162024.12 | 74.8 | — | — | — | 75 | — | |
| DualPDBackbone=Qwen-2-VL-7B, Decoding Strategy=DualPD2026.01 | 74.72 | — | — | — | — | — | |
| AutoVBackbone=Qwen2.5-VL 7B2025.06 | 74.4 | — | — | — | — | — | |
| DoLABackbone=Qwen-2.5-VL-7B, Decoding Strategy=DoLA2026.01 | 74.38 | — | — | — | — | — | |
| Qwen-2.5-VL-7BBackbone=Qwen-2.5-VL-7B, Decoding Strategy=Standard2026.01 | 74.11 | — | — | — | — | — | |
| FastVBackbone=LLaVA-1.5-7B, Retained Tokens=642026.04 | 73.88 | — | — | — | 50.8 | 101.6 | |
| GPTQModel=Qwen2-VL-72B, Bitwidth=W3A162024.12 | 73.6 | — | — | — | 76.6 | — | |
| MBQModel=Qwen2-VL-72B, Bitwidth=W4A82024.12 | 73.6 | — | — | — | 75.8 | — | |
| ToMeBackbone=LLaVA-1.5-7B, Retained Tokens=642026.04 | 73.34 | — | — | — | 50.2 | 100.4 | |
| DoLABackbone=Qwen-2-VL-7B, Decoding Strategy=DoLA2026.01 | 73.05 | — | — | — | — | — | |
| Qwen-2-VL-7BBackbone=Qwen-2-VL-7B, Decoding Strategy=Standard2026.01 | 72.73 | — | — | — | — | — | |
| APIBackbone=Qwen2.5-VL 7B2025.06 | 72.1 | — | — | — | — | — | |
| PaLI-17B#Params=17B, Model Type=Specialist, Evaluation Protocol=Fine-tuned2023.11 | 71.6 | — | — | — | — | — | |
| MASQuantModel=Qwen2.5-VL-7B, Bits=W4A162026.03 | 71.5 | — | — | — | — | — | |
| RTNModel=Qwen2-VL-72B, Bitwidth=W4A82024.12 | 71.3 | — | — | — | 73.2 | — | |
| TABackbone=LLaVA, Adapter Rank=16, Optimization Strategy=gradient-free2026.03 | 71.3 | — | — | — | — | — | |
| LocoREBackbone=Qwen2.5-VL, Model Size=32B, Inference Strategy=LocoRE2026.01 | 71.2 | — | — | — | — | — | |
| AuroraEdge-V-2BNumber of parameters=2B2026.01 | 71.05 | — | — | — | — | — | |
| GIT2#Params=5.1B, Model Type=Specialist, Evaluation Protocol=Fine-tuned2023.11 | 71 | — | — | — | — | — | |
| PALI-X-55Bmode=specialist2023.08 | 70.9 | — | — | — | — | — | |
| PaLI-X-55BModel Type=Specialist SOTA2023.10 | 70.9 | — | — | — | — | — | |
| Qwen2.5-VL-32BBackbone=Qwen2.5-VL, Model Size=32B, Inference Strategy=Base2026.01 | 70.8 | — | — | — | — | — | |
| FGVPBackbone=Qwen2.5-VL 7B2025.06 | 70.8 | — | — | — | — | — | |
| DenseModel=Qwen2.5-VL-7B, Bits=FP162026.03 | 70.8 | — | — | — | — | — | |
| FP16Backbone=Qwen2.5-VL-7B, Bits=W16A162026.05 | 70.8 | — | — | — | — | — | |
| AWQModel=Qwen2.5-VL-7B, Bits=W4A162026.03 | 70.6 | — | — | — | — | — | |
| MBQModel=Qwen2.5-VL-7B, Bits=W4A162026.03 | 70.6 | — | — | — | — | — | |
| MBQModel=Qwen2.5-VL-7B, Bits=W8A82026.03 | 70.6 | — | — | — | — | — | |
| MASQuantModel=Qwen2.5-VL-7B, Bits=W8A82026.03 | 70.6 | — | — | — | — | — | |
| BaselineBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=1.00×, Channel multiplier=1.00×, KV Cache budget multiplier=1.00×2026.05 | 70.58 | — | — | — | — | — | |
| RTNModel=Qwen2.5-VL-7B, Bits=W8A82026.03 | 70.5 | — | — | — | — | — | |
| Qwen2.5-VL 7B, DenseBackbone=Qwen2.5-VL 7B, Sparsity=Dense2026.03 | 70.48 | — | — | — | — | — | |
| Qwen2.5-VL-7BToken Budget=100%2025.08 | 70.4 | — | — | — | — | — | |
| Qwen2.5-VL-3BNumber of parameters=3B2026.01 | 70.35 | — | — | — | — | — | |
| FastV + RotateKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.40×, Channel multiplier=0.25×, KV Cache budget multiplier=0.25×2026.05 | 70.32 | — | — | — | — | — | |
| VisionZip + RotateKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.45×, Channel multiplier=0.25×, KV Cache budget multiplier=0.28×2026.05 | 70.13 | — | — | — | — | — | |
| SQModel=Qwen2.5-VL-7B, Bits=W8A82026.03 | 70 | — | — | — | — | — | |
| TIESBackbone=LLaVA, Adapter Rank=16, Optimization Strategy=gradient-free2026.03 | 69.8 | — | — | — | — | — | |
| SQModel=Qwen2-VL-72B, Bitwidth=W4A82024.12 | 69.7 | — | — | — | 72.2 | — | |
| FinetunedBackbone=LLaVA, Adapter Rank=162026.03 | 69.7 | — | — | — | — | — | |
| BaseBackbone=Qwen2.5-VL 7B2025.06 | 69.5 | — | — | — | — | — | |
| FastV + ThinKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.40×, Channel multiplier=0.25×, KV Cache budget multiplier=0.25×2026.05 | 69.25 | — | — | — | — | — | |
| FP16Model=LLaVA-onevision-72B, Bitwidth=FP162024.12 | 69.2 | — | — | — | 74.3 | — | |
| CircleBackbone=Qwen2.5-VL 7B2025.06 | 69.2 | — | — | — | — | — | |
| HiPruneBase Model=Qwen2.5-VL-7B, Token Budget=33.3%2025.08 | 69.2 | — | — | — | — | — | |
| FastV (token only)Backbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.25×, Channel multiplier=1.00×, KV Cache budget multiplier=0.25×2026.05 | 69.13 | — | — | — | — | — | |
| DenseModel=Qwen2.5-VL-3B, Bits=FP162026.03 | 69.1 | — | — | — | — | — | |
| FP16Backbone=Qwen2.5-VL-3B, Bits=W16A162026.05 | 69.1 | — | — | — | — | — | |
| MBQModel=LLaVA-onevision-72B, Bitwidth=W3A162024.12 | 69 | — | — | — | 73.6 | — | |
| HiPrune++Base Model=Qwen2.5-VL-7B, Token Budget=33.3%2025.08 | 69 | — | — | — | — | — | |
| VisionZip (token only)Backbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.28×, Channel multiplier=1.00×, KV Cache budget multiplier=0.28×2026.05 | 68.97 | — | — | — | — | — | |
| VisionZip + ThinKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.45×, Channel multiplier=0.25×, KV Cache budget multiplier=0.28×2026.05 | 68.93 | — | — | — | — | — | |
| Qwen2.5-VL-3BToken Budget=100%2025.08 | 68.9 | — | — | — | — | — | |
| SplitQBackbone=Qwen2.5-VL-7B, Bits=W4A82026.05 | 68.7 | — | — | — | — | — | |
| MBQModel=Qwen2.5-VL-3B, Bits=W8A82026.03 | 68.6 | — | — | — | — | — | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B2026.04 | 68.6 | — | — | — | — | — | |
| HiPruneBase Model=Qwen2.5-VL-7B, Token Budget=22.2%2025.08 | 68.6 | — | — | — | — | — | |
| HiPrune++Base Model=Qwen2.5-VL-7B, Token Budget=22.2%2025.08 | 68.5 | — | — | — | — | — | |
| TLQModel=Qwen2-VL-7b, Bitwidth=W8A82026.02 | 68.4 | — | — | — | — | — | |
| AutoVBackbone=LLaVA-OneVision 7B2025.06 | 68.4 | — | — | — | — | — | |
| SplitQBackbone=Qwen2.5-VL-7B, Bits=W4A42026.05 | 68.4 | — | — | — | — | — | |
| FP16 BaselineModel=Qwen2-VL-7B, Bitwidth=FP162026.03 | 68.34 | — | — | — | — | — | |
| Qwen2-VL 7BBackbone=Qwen2-VL 7B, Sparsity Level=0%, Pruning Method=Dense, Pruning Type=None2026.03 | 68.33 | — | — | — | — | 100 | |
| GPTQModel=LLaVA-onevision-72B, Bitwidth=W3A162024.12 | 68.3 | — | — | — | 72.3 | — | |
| Qwen2-VL-7bBitwidth=fp162026.02 | 68.3 | — | — | — | — | — | |
| MBQModel=Qwen2-VL-7b, Bitwidth=W8A82026.02 | 68.3 | — | — | — | — | — | |
| fp16Model=Qwen2-VL-7b, Bitwidth=fp162026.02 | 68.3 | — | — | — | — | — |