Text-based Visual Question Answering on TextVQA (Accuracy)
88.5AccuracyQ-Mask
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Q-MaskSize=3B2026.03 | 88.5 | — | — | |
| Qwen2.5-VL-32B + VPPOZero-shot=true2026.02 | 86.2 | — | — | |
| ToolTreeBackbone Model=GPT-4o2026.03 | 85.43 | — | — | |
| DualPDBackbone=Qwen-2.5-VL-7B, Decoding Strategy=DualPD2026.01 | 85.34 | — | — | |
| Qwen2.5-VL-32B + AT-RL (Ours)Zero-shot=true2026.02 | 85.3 | — | — | |
| Qwen2.5VLModel Scale=7B, Date=2025.02, Tokenization Paradigm=Understanding-only Models2026.02 | 84.9 | — | — | |
| Qwen2.5-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 84.9 | — | — | |
| Qwen2.5-VLSize=7B2026.03 | 84.9 | — | — | |
| DualPDBackbone=Qwen-2-VL-7B, Decoding Strategy=DualPD2026.01 | 84.84 | — | — | |
| Qwen2.5-VL-7BToken Pruning Rate=0%2026.04 | 84.8 | — | — | |
| Qwen2.5-VL-32B InstructZero-shot=true2026.02 | 84.6 | — | — | |
| LLaVA-OVLLM=Qwen2-7B, Number of Parameters=~7B2026.02 | 84.5 | — | — | |
| Qwen2.5-VL-72B InstructZero-shot=true2026.02 | 84.3 | — | — | |
| ManzanoModel Scale=30B, Date=2025.09, Tokenization Paradigm=Hybrid Tokenization2026.02 | 84.3 | — | — | |
| Qwen2-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 84.3 | — | — | |
| InternVL3.5Size=78B2026.03 | 84.3 | — | — | |
| DoLABackbone=Qwen-2.5-VL-7B, Decoding Strategy=DoLA2026.01 | 84.19 | — | — | |
| DoLABackbone=Qwen-2-VL-7B, Decoding Strategy=DoLA2026.01 | 83.99 | — | — | |
| Qwen-2.5-VL-7BBackbone=Qwen-2.5-VL-7B, Decoding Strategy=Standard2026.01 | 83.72 | — | — | |
| Latent DenoisingArchitecture=Qwen-2.5-VL2026.04 | 83.7 | — | — | |
| Qwen2.5-VLSize=72B2026.03 | 83.5 | — | — | |
| Qwen-2-VL-7BBackbone=Qwen-2-VL-7B, Decoding Strategy=Standard2026.01 | 83.34 | — | — | |
| VanillaBackbone=Qwen2-VL-7B, Flops Ratio Reduction=0%2026.04 | 83.2 | — | — | |
| MolmoSize=72B2026.03 | 83.1 | — | — | |
| DenseModel=Qwen2.5-VL-7B, Bits=FP162026.03 | 82.9 | — | — | |
| MBQModel=Qwen2.5-VL-7B, Bits=W4A162026.03 | 82.9 | — | — | |
| MBQModel=Qwen2.5-VL-7B, Bits=W8A82026.03 | 82.9 | — | — | |
| DeFactoBackbone=Qwen2.5-VL-7B2025.09 | 82.9 | — | — | |
| InternVL3.5Size=38B2026.03 | 82.7 | — | — | |
| SQModel=Qwen2.5-VL-7B, Bits=W8A82026.03 | 82.6 | — | — | |
| MASQuantModel=Qwen2.5-VL-7B, Bits=W8A82026.03 | 82.6 | — | — | |
| Q-MaskSize=2B2026.03 | 82.6 | — | — | |
| FP16Model=Qwen2-VL-72B, Bitwidth=FP162024.12 | 82.5 | — | 78.1 | |
| MBQModel=Qwen2-VL-72B, Bitwidth=W3A162024.12 | 82.5 | — | 77.6 | |
| MASQuantModel=Qwen2.5-VL-7B, Bits=W4A162026.03 | 82.5 | — | — | |
| RTNModel=Qwen2.5-VL-7B, Bits=W8A82026.03 | 82.5 | — | — | |
| AWQModel=Qwen2-VL-72B, Bitwidth=W3A162024.12 | 82.4 | — | 77.5 | |
| ToolTreeBackbone Model=GPT-4o-mini2026.03 | 82.26 | — | — | |
| Full ModelBackbone=Qwen3-VL-8B-Instruct, Pruning Ratio=0%2026.02 | 82.24 | — | — | |
| AWQModel=Qwen2.5-VL-7B, Bits=W4A162026.03 | 82.2 | — | — | |
| Qwen2-VL-7B-InstructMitigation=None (baseline)2025.07 | 82.2 | — | — | |
| SENTINELBase Model=Qwen2-VL-7B-Instruct2025.07 | 82.2 | — | — | |
| FP16Model=InternVL2-26B, Bitwidth=FP162024.12 | 82.1 | — | 74.6 | |
| RTNModel=Qwen2.5-VL-7B, Bits=W4A162026.03 | 82.1 | — | — | |
| Qwen3-VLSize=8B2026.03 | 82.1 | — | — | |
| BaselineArchitecture=Qwen-2.5-VL2026.04 | 81.8 | — | — | |
| Qwen2VL-7BModel size=7B2025.04 | 81.7 | — | — | |
| VanillaBackbone=Qwen3-VL-4B-FP8, Flops Ratio Reduction=0%, Precision=FP82026.04 | 81.7 | — | — | |
| GPTQModel=Qwen2-VL-72B, Bitwidth=W3A162024.12 | 81.6 | — | 76.6 | |
| KelixModel Scale=8B, Tokenization Paradigm=Discrete Tokenization2026.02 | 81.4 | — | — | |
| MBQModel=InternVL2-26B, Bitwidth=W3A162024.12 | 81.1 | — | 73.8 | |
| WandaBackbone=Qwen3-VL-8B-Instruct, Pruning Ratio=30%2026.02 | 81.08 | — | — | |
| AWQModel=InternVL2-26B, Bitwidth=W3A162024.12 | 81 | — | 73.5 | |
| Qwen3-VL + DISCO (10K)Backbone=Qwen3-VL, Alignment Strategy=DISCO (10K)2026.02 | 80.83 | — | — | |
| POPBackbone=Qwen3-VL-8B-Instruct, Pruning Ratio=33.3%2026.02 | 80.73 | — | — | |
| RTNModel=InternVL2-26B, Bitwidth=W3A162024.12 | 80.6 | — | 73.3 | |
| VQ-RAEModel Scale=7B, Date=2025.11, Tokenization Paradigm=Hybrid Tokenization2026.02 | 80.6 | — | — | |
| Qwen3-VLSize=4B2026.03 | 80.6 | — | — | |
| MBQModel=Qwen2-VL-72B, Bitwidth=W4A82024.12 | 80.5 | — | 75.8 | |
| SpaRE-7BModel size=7B2025.04 | 80.5 | — | — | |
| OpenAI GPT-4oZero-shot=true2026.02 | 80.5 | — | — | |
| Qwen3-VLBackbone=Qwen3-VL2026.02 | 80.34 | — | — | |
| InternVL3Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 80.2 | — | — | |
| Qwen3-VLToken Ratio=Full Tokens2026.06 | 80.2 | — | — | |
| GPTQModel=InternVL2-26B, Bitwidth=W3A162024.12 | 80.1 | — | 72.3 | |
| DualPDBackbone=LLaVA-1.6-13B, Decoding Strategy=DualPD2026.01 | 80.1 | — | — | |
| MBQModel=InternVL2-26B, Bitwidth=W4A82024.12 | 80 | — | 72.7 | |
| BagelModel Scale=14B, Date=2025.05, Tokenization Paradigm=Continuous Tokenization2026.02 | 80 | — | — | |
| Qwen3-VL + Textual (10K)Backbone=Qwen3-VL, Alignment Strategy=Textual (10K)2026.02 | 79.91 | — | — | |
| RTNModel=Qwen2-VL-72B, Bitwidth=W3A162024.12 | 79.7 | — | 75 | |
| Qwen2.5VLModel Scale=3B, Date=2025.02, Tokenization Paradigm=Understanding-only Models2026.02 | 79.7 | — | — | |
| Qwen2-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 79.7 | — | — | |
| CASTRatio=1%, Sampling Strategy=CAST, Backbone=Qwen2-VL-2B2026.05 | 79.68 | — | — | |
| RTNModel=InternVL2-26B, Bitwidth=W4A82024.12 | 79.6 | — | 72.7 | |
| GLM-4.1VSize=9B2026.03 | 79.6 | — | — | |
| DeSAPToken Pruning Rate=66.7%2026.04 | 79.5 | — | — | |
| CASTRatio=10%, Sampling Strategy=CAST, Backbone=Qwen2-VL-2B2026.05 | 79.43 | — | — | |
| CASTRatio=5%, Sampling Strategy=CAST, Backbone=Qwen2-VL-2B2026.05 | 79.4 | — | — | |
| FP16Model=LLaVA-onevision-72B, Bitwidth=FP162024.12 | 79.3 | — | 74.3 | |
| Qwen2.5-VL 3B (reported)Res.=Native2025.12 | 79.3 | — | — | |
| Qwen2.5-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 79.3 | — | — | |
| TokenVL-8BSize=8B2026.03 | 79.3 | — | — | |
| Qwen2.5-VLSize=3B2026.03 | 79.3 | — | — | |
| Qwen3-VLSize=2B2026.03 | 79.3 | — | — | |
| SpaRE-2BModel size=2B2025.04 | 79.2 | — | — | |
| Qwen2.5-VL 3B (reproduced)Res.=≤ 896²2025.12 | 79.2 | — | — | |
| RandomRatio=10%, Sampling Strategy=Random, Backbone=Qwen2-VL-2B2026.05 | 79.15 | — | — | |
| InternVL2.5Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 79.1 | — | — | |
| Qwen2.5-VLBackbone=Qwen2.5-VL-7B2025.09 | 79.1 | — | — | |
| HoloVToken Pruning Rate=66.7%2026.04 | 78.9 | — | — | |
| RandomRatio=5%, Sampling Strategy=Random, Backbone=Qwen2-VL-2B2026.05 | 78.61 | — | — | |
| MBQModel=LLaVA-onevision-72B, Bitwidth=W3A162024.12 | 78.5 | — | 73.6 | |
| InternVL3.5Size=20B2026.03 | 78.5 | — | — | |
| SENTINELBase Model=Qwen2-VL-2B-Instruct2025.07 | 78.5 | — | — | |
| Oryx-1.5Size=32B2024.09 | 78.3 | — | — | |
| Qwen2-VL-2B-InstructMitigation=None (baseline)2025.07 | 78.3 | — | — | |
| LLaVA-1.6-13BBackbone=LLaVA-1.6-13B, Decoding Strategy=Greedy2026.01 | 78.2 | — | — | |
| DoLABackbone=LLaVA-1.6-13B, Decoding Strategy=DoLA2026.01 | 78.2 | — | — | |
| InternVL3.5Size=8B2026.03 | 78.2 | — | — | |
| RandomRatio=1%, Sampling Strategy=Random, Backbone=Qwen2-VL-2B2026.05 | 78.13 | — | — |