Visual Question Answering on TextVQA
85.4AccuracyQwen2.5-VL-7B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Token Retention Ratio=100%2025.12 | 85.4 | — | — | — | — | |
| BaselineModel=Llama Nemotron Nano 12B v2 VL2026.01 | 85.2 | — | — | — | — | |
| QADModel=Llama Nemotron Nano 12B v2 VL2026.01 | 85.2 | — | — | — | — | |
| Qwen2.5-VL 72BLLM=Qwen2.5-72B2025.12 | 84.9 | — | — | — | — | |
| QwenVL2.5-7BModel Size=7B2026.02 | 84.9 | — | — | — | — | |
| PTQModel=Llama Nemotron Nano 12B v2 VL2026.01 | 84.8 | — | — | — | — | |
| QATModel=Llama Nemotron Nano 12B v2 VL2026.01 | 84.8 | — | — | — | — | |
| Qwen2-VLLLM Param=7B, Type=Und. Only2024.11 | 84.3 | — | — | — | — | |
| FP16Model=Qwen2VL-7B, Spiking=false, Time Step=N/A2026.04 | 84.11 | — | — | — | — | |
| DPOBackbone=Qwen2.5-VL-7B2026.02 | 83.94 | — | — | — | — | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.02 | 83.75 | — | — | — | — | |
| Pragma-VLBackbone=Qwen2.5-VL-7B2026.02 | 83.75 | — | — | — | — | |
| SpikeMLLM(QuaRot+MSTS+TC-LIF)Model=Qwen2VL-7B, Spiking=true, Time Step=3/42026.04 | 83.46 | — | — | — | — | |
| InternVL-2.5-26B*Latency=0.74542025.12 | 83.26 | — | — | — | — | |
| MM-RLHFBackbone=Qwen2.5-VL-7B2026.02 | 83.26 | — | — | — | — | |
| DivPruneBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 83.1 | — | — | — | — | |
| RoboInter-Qwen-7BModel Size=7B, Backbone=Qwen2026.02 | 83 | — | — | — | — | |
| BasePruning Ratio=100%, Base Model=Qwen3-VL-8B, Zero-shot evaluation=True2026.05 | 82.98 | — | — | — | — | |
| FP16Backbone=Qwen2.5-VL-7B, Bits=W16A162026.05 | 82.9 | — | — | — | — | |
| Beavertails-V_helpBackbone=Qwen2.5-VL-7B2026.02 | 82.84 | — | — | — | — | |
| DivPrune + RandomBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 82.8 | — | — | — | — | |
| InternVL3.5-38BLLM=Qwen3-32B2025.12 | 82.7 | — | — | — | — | |
| DART + RandomBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 82.7 | — | — | — | — | |
| SpikeMLLM(QuaRot)Model=Qwen2VL-7B, Spiking=true, Time Step=152026.04 | 82.64 | — | — | — | — | |
| SplitQBackbone=Qwen2.5-VL-7B, Bits=W4A82026.05 | 82.6 | — | — | — | — | |
| SplitQBackbone=Qwen2.5-VL-7B, Bits=W4A42026.05 | 82.5 | — | — | — | — | |
| InternVL2-26Btoken ratio=100%2024.12 | 82.45 | 100 | — | — | — | |
| SGPtoken ratio=64%2024.12 | 82.41 | 100.14 | — | — | — | |
| InternVL-2.5-26BLatency=0.74542025.12 | 82.4 | — | — | — | — | |
| IVC-PrunePruning Ratio=-65.11%, Base Model=Qwen3-VL-8B, Zero-shot evaluation=True2026.05 | 82.35 | — | — | — | — | |
| HII-DPOModel=Qwen2-VL-7B-Instruct2026.02 | 82.3 | — | — | — | — | |
| FastVtoken ratio=64%2024.12 | 82.26 | 99.84 | — | — | — | |
| Qwen2-VL-7B-InstructMethod=baseline2026.02 | 82.2 | — | — | — | — | |
| ERASEPruning Ratio=-65.11%, Base Model=Qwen3-VL-8B, Zero-shot evaluation=True2026.05 | 82.12 | — | — | — | — | |
| DARTBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 82.1 | — | — | — | — | |
| fp16Model=Qwen2-VL-7b, Bitwidth=fp162026.02 | 82 | — | — | — | — | |
| SGPtoken ratio=35%2024.12 | 81.97 | 98.36 | — | — | — | |
| SFTBackbone=Qwen2.5-VL-7B2026.02 | 81.83 | — | — | — | — | |
| ERASEPruning Ratio=-72.77%, Base Model=Qwen3-VL-8B, Zero-shot evaluation=True2026.05 | 81.77 | — | — | — | — | |
| IVC-PrunePruning Ratio=-72.77%, Base Model=Qwen3-VL-8B, Zero-shot evaluation=True2026.05 | 81.74 | — | — | — | — | |
| EMOVAModel Size=72B2024.09 | 81.4 | — | — | — | — | |
| ERASEPruning Ratio=-84.43%, Base Model=Qwen3-VL-8B, Zero-shot evaluation=True2026.05 | 81.18 | — | — | — | — | |
| Direct Fine-tuning (r=1)Optimization steps=+200 steps2026.02 | 81.04 | — | — | — | — | |
| Robobrain-2.0-3BModel Size=3B2026.02 | 81 | — | — | — | — | |
| Direct Fine-tuning (r=1)Optimization steps=+0 steps2026.02 | 80.96 | — | — | — | — | |
| SpikeMLLM(GPTQ)Model=Qwen2VL-7B, Spiking=true, Time Step=2552026.04 | 80.9 | — | — | — | — | |
| In-Squeeze (128 ... -> 1)Optimization mode=Standard2026.02 | 80.84 | — | — | — | — | |
| PaLI-XOCR pipeline input=true, Resolution=812x8122023.10 | 80.78 | — | — | — | — | |
| PaLI-3OCR pipeline input=true, Resolution=812x8122023.10 | 80.78 | — | — | — | — | |
| Cont-Squeeze (128 -> 1)Optimization steps=+200 steps2026.02 | 80.72 | — | — | — | — | |
| Direct Fine-tuning (r=1)Optimization steps=+700 steps2026.02 | 80.63 | — | — | — | — | |
| In-Squeeze (128 ... -> 1)Optimization mode=Min steps2026.02 | 80.31 | — | — | — | — | |
| SPA-VLBackbone=Qwen2.5-VL-7B2026.02 | 80.31 | — | — | — | — | |
| ToMetoken ratio=64%2024.12 | 80.22 | 94.24 | — | — | — | |
| InternVL3-8BModel Size=8B2026.02 | 80.2 | — | — | — | — | |
| LUVCBackbone=InternVL-2.5-26B*, Latency=0.4302, Speedup=1.732025.12 | 80.03 | — | — | — | — | |
| Cont-Squeeze (128 -> 1)Optimization steps=+700 steps2026.02 | 79.71 | — | — | — | — | |
| PaLI-3OCR pipeline input=false, Resolution=812x8122023.10 | 79.51 | — | — | — | — | |
| fp16Model=Qwen2-VL-2b, Bitwidth=fp162026.02 | 79.5 | — | — | — | — | |
| QwenVL2.5-3BModel Size=3B2026.02 | 79.3 | — | — | — | — | |
| Cont-Squeeze (128 -> 1)Optimization steps=+0 steps2026.02 | 79.27 | — | — | — | — | |
| InternVL-2.5-8BLatency=0.29852025.12 | 79.1 | — | — | — | — | |
| InternVL-2.5-8B*Latency=0.29852025.12 | 78.99 | — | — | — | — | |
| SGPtoken ratio=9%2024.12 | 78.98 | 89.58 | — | — | — | |
| Qwen-VL-Plus2024.06 | 78.9 | — | — | — | — | |
| RoboInter-Qwen-3BModel Size=3B, Backbone=Qwen2026.02 | 78.9 | — | — | — | — | |
| QwenVL2.5-3BModel size=3B2026.05 | 78.62 | — | — | — | — | |
| PACTBackbone=InternVL-2.5-26B*, Latency=0.4690, Speedup=1.592025.12 | 78.56 | — | — | — | — | |
| SplitQBackbone=Qwen2.5-VL-7B, Bits=W3A32026.05 | 78.5 | — | — | — | — | |
| HII-DPOModel=Qwen2.5-VL-7B-Instruct2026.02 | 78.4 | — | — | — | — | |
| BalCapRL-3BBackbone=QwenVL2.5-3B2026.05 | 78.4 | — | — | — | — | |
| Beavertails-V_harmBackbone=Qwen2.5-VL-7B2026.02 | 78.32 | — | — | — | — | |
| Qwen2-VL-2B-InstructMethod=baseline2026.02 | 78.3 | — | — | — | — | |
| SpikeMLLM(QuaRot+MSTS+TC-LIF)Model=Qwen2VL-7B, Spiking=true, Time Step=2/32026.04 | 78.28 | — | — | — | — | |
| FP16Model=MiniCPM-V-2.6-8B, Spiking=false, Time Step=N/A2026.04 | 78.26 | — | — | — | — | |
| IXC 2.5Size=7B, Visual tokens=51182024.09 | 78.2 | — | — | — | — | |
| HII-DPOModel=Qwen2-VL-2B-Instruct2026.02 | 78.2 | — | — | — | — | |
| GPT-4V2024.06 | 78 | — | — | — | — | |
| GPT-4VSize=n/a, Evaluation Protocol=Zero-shot2025.02 | 78 | — | — | — | — | |
| EMOVAModel Size=7B2024.09 | 78 | — | — | — | — | |
| GPT-4V-11062026.05 | 78 | — | — | — | — | |
| FP16Backbone=Qwen2.5-VL-3B, Bits=W16A162026.05 | 77.9 | — | — | — | — | |
| MoVALLM=Hermes-Yi-34B, Params=38B, Model Type=Specialist2024.04 | 77.8 | — | — | — | — | |
| LUVCBackbone=InternVL-2.5-8B*, Latency=0.1857, Speedup=1.612025.12 | 77.8 | — | — | — | — | |
| FP16Model=InternVL2-8B, Spiking=false, Time Step=N/A2026.04 | 77.71 | — | — | — | — | |
| Qwen2.5-VL-7B-InstructMethod=baseline2026.02 | 77.7 | — | — | — | — | |
| IVC-PrunePruning Ratio=-84.43%, Base Model=Qwen3-VL-8B, Zero-shot evaluation=True2026.05 | 77.65 | — | — | — | — | |
| SpikeMLLM(QuaRot+MSTS+TC-LIF)Model=MiniCPM-V-2.6-8B, Spiking=true, Time Step=3/42026.04 | 77.64 | — | — | — | — | |
| Visual CoTLLM=Vicuna-7B2024.08 | 77.5 | — | — | — | — | |
| Qwen3-VL + DiGLLM=Qwen3-8B2025.12 | 77.5 | — | — | — | — | |
| InternVL 2Size=8B, Visual tokens=31332024.09 | 77.4 | — | — | — | — | |
| GPT-4V2024.09 | 77.4 | — | — | — | — | |
| SplitQBackbone=Qwen2.5-VL-3B, Bits=W4A82026.05 | 77.4 | — | — | — | — | |
| SpikeMLLM(QuaRot)Model=MiniCPM-V-2.6-8B, Spiking=true, Time Step=152026.04 | 77.35 | — | — | — | — | |
| SpikeMLLM(GPTQ)Model=MiniCPM-V-2.6-8B, Spiking=true, Time Step=2552026.04 | 77.21 | — | — | — | — | |
| EMOVAModel Size=3B2024.09 | 77.2 | — | — | — | — | |
| MoVALLM=Llama3-8B, Params=11B, Model Type=Specialist2024.04 | 77.1 | — | — | — | — | |
| InternVL3-2BModel Size=2B2026.02 | 77 | — | — | — | — | |
| SplitQBackbone=Qwen2.5-VL-3B, Bits=W4A42026.05 | 77 | — | — | — | — | |
| MASQBackbone=Qwen2.5-VL-7B, Bits=W4A82026.05 | 77 | — | — | — | — |