Visual Question Answering on TextVQA (TextVQA Metric)
85.9TextVQA AccuracyAttWarp-Chain
Evaluation Results
| Method | Links | |
|---|---|---|
| AttWarp-ChainBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Adaptive Chains2025.10 | 85.9 | |
| Qwen2.5-VL#Params=7B, Model Category=Vision Language Models, Co-training=false2026.05 | 84.9 | |
| Qwen2.5-VLLLM=Qwen2.5-7B, Token Type=2D-Continuous dynamic2026.05 | 84.9 | |
| AttWarpBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Rectilinear warping2025.10 | 84.7 | |
| Qwen2-VL#Params=7B, Model Category=Vision Language Models, Co-training=false2026.05 | 84.3 | |
| DeepSeek-VL2#Params=4B/27B, Model Category=Vision Language Models, Co-training=false2026.05 | 84.2 | |
| UAM#Params=7B MoT, Model Category=Vision-Language-Action Models, Co-training=false2026.05 | 84.2 | |
| AttWarp-DistillBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Efficient inference2025.10 | 84.1 | |
| ViCropBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Add object crop2025.10 | 83.8 | |
| Qwen2.5VL 7B# Vis tok.=14002025.04 | 83.5 | |
| Qwen2.5-VL-7BToken Budget=100%2025.08 | 83.1 | |
| BLIP3-oLLM=Qwen2.5VL-7B-Instruct, Token Type=2D-Continuous dynamic2026.05 | 83.1 | |
| BaselineBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=1.00×, Channel multiplier=1.00×, KV Cache budget multiplier=1.00×2026.05 | 82.92 | |
| FastV + RotateKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.40×, Channel multiplier=0.25×, KV Cache budget multiplier=0.25×2026.05 | 82.38 | |
| Vanilla2026.04 | 82.1 | |
| Qwen3-VL-4BModel=Qwen3-VL, Parameter Count=4B2026.04 | 81.86 | |
| APIBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Alpha channel fade2025.10 | 81.6 | |
| FastV (token only)Backbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.25×, Channel multiplier=1.00×, KV Cache budget multiplier=0.25×2026.05 | 81.49 | |
| Base MLLMBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Cross-attention VL adapter & partially closed data2025.10 | 81 | |
| VisionZip + RotateKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.45×, Channel multiplier=0.25×, KV Cache budget multiplier=0.28×2026.05 | 80.84 | |
| DeepSeek-VL2-Tiny# Vis tok.=15002025.04 | 80.7 | |
| Molmo 7B# Vis tok.=12002025.04 | 80.4 | |
| UniVLRVariant=Ours2026.05 | 80.4 | |
| CropVLMReward=Accuracy, Backbone=Qwen 2.5 VL, Input Resolution=1792x1792, CropVLM Resolution=2048x20482025.11 | 80.12 | |
| CropVLMReward=LL, Backbone=Qwen 2.5 VL, Input Resolution=1792x1792, CropVLM Resolution=2048x20482025.11 | 80.07 | |
| FLARE-X 8B# Vis tok.=14002025.04 | 79.7 | |
| Qwen2-VL#Params=1.5B, Model Category=Vision Language Models, Co-training=false2026.05 | 79.7 | |
| Qwen2.5VL 3B# Vis tok.=14002025.04 | 79.3 | |
| SkiLaModel=SkiLa2026.05 | 79.3 | |
| Qwen2.5-VL#Params=3B, Model Category=Vision Language Models, Co-training=false2026.05 | 79.3 | |
| SLVR-7BReasoning Paradigm=Visual + Semantic Latent2026.05 | 79.3 | |
| Qwen2.5-VL-3BModel=Qwen2.5-VL, Parameter Count=3B2026.04 | 79.29 | |
| Qwen 2.5 VLInput Resolution=1792x17922025.11 | 79.14 | |
| UniVLRStage=12026.05 | 79.1 | |
| InternVL2.5LLM=InternLM2.5-7B, Token Type=2D-Continuous dynamic2026.05 | 79.1 | |
| Qwen2.5-VL-7BReasoning Paradigm=Text-only2026.05 | 79.1 | |
| BaseRatio=100%, Backbone=Qwen2.5-VL-3B2026.05 | 79.06 | |
| ERASERatio=-62.1%, Backbone=Qwen2.5-VL-3B2026.05 | 78.62 | |
| HiPruneBase Model=Qwen2.5-VL-7B, Token Budget=33.3%2025.08 | 78.5 | |
| InfiniteVL-4BModel=InfiniteVL, Parameter Count=4B, Result Source=InfiniteVL (Tao et al., 2025) paper2026.04 | 78.5 | |
| LLaVA-OneVision 7B# Vis tok.=24002025.04 | 78.5 | |
| ERASERatio=-75.0%, Backbone=Qwen2.5-VL-3B2026.05 | 77.95 | |
| HiPrune++Base Model=Qwen2.5-VL-7B, Token Budget=33.3%2025.08 | 77.9 | |
| FastV + ThinKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.40×, Channel multiplier=0.25×, KV Cache budget multiplier=0.25×2026.05 | 77.81 | |
| Qwen2.5-VL-3BToken Budget=100%2025.08 | 77.8 | |
| Qwen2.5-VL-7BModel=Qwen2.5-VL-7B2026.05 | 77.5 | |
| IVC-PruneRatio=-62.1%, Backbone=Qwen2.5-VL-3B2026.05 | 77.32 | |
| FGVP-maskBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Green mask overlay2025.10 | 77.3 | |
| CDPrunerRatio=-62.1%, Backbone=Qwen2.5-VL-3B2026.05 | 77.25 | |
| FLARE-X 3B# Vis tok.=14002025.04 | 77.2 | |
| Eagle 8B# Vis tok.=10242025.04 | 77.1 | |
| VisionZip (token only)Backbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.28×, Channel multiplier=1.00×, KV Cache budget multiplier=0.28×2026.05 | 76.84 | |
| MiniCPM-Llama3-V-2.5 8B# Vis tok.=4002025.04 | 76.6 | |
| VanillaToken Retention Ratio=100%2026.05 | 76.5 | |
| ERASERatio=-85.0%, Backbone=Qwen2.5-VL-3B2026.05 | 76.23 | |
| FLARE-L 8B# Vis tok.=6302025.04 | 76.2 | |
| SPprunerToken Retention Ratio=70%2026.05 | 76 | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=1024, Cropping Strategy=CropVLM2025.11 | 75.97 | |
| LLaVA-OneVision-7BModel=LLaVA-OneVision, Parameter Count=7B2026.04 | 75.92 | |
| DARTToken Retention Ratio=70%2026.05 | 75.9 | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=2048, Cropping Strategy=CropVLM2025.11 | 75.72 | |
| VisionZip + ThinKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.45×, Channel multiplier=0.25×, KV Cache budget multiplier=0.28×2026.05 | 75.72 | |
| CDPrunerRatio=-75.0%, Backbone=Qwen2.5-VL-3B2026.05 | 75.61 | |
| LVRModel=LVR2026.05 | 75.6 | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=512, Cropping Strategy=CropVLM2025.11 | 75.46 | |
| SPprunerToken Retention Ratio=50%2026.05 | 75.3 | |
| LVRReasoning Paradigm=Visual Latent2026.05 | 75.1 | |
| IVC-PruneRatio=-75.0%, Backbone=Qwen2.5-VL-3B2026.05 | 75.06 | |
| DASHViT retain tokens=50%, LLM retain tokens=50%2026.04 | 74.7 | |
| DARTToken Retention Ratio=50%2026.05 | 74.6 | |
| Florence-VL 8B# Vis tok.=5762025.04 | 74.2 | |
| HiPruneBase Model=Qwen2.5-VL-7B, Token Budget=22.2%2025.08 | 74.1 | |
| MiniCPM-V-2.0 3B# Vis tok.=4002025.04 | 74.1 | |
| FLARE-L 3B# Vis tok.=6302025.04 | 73.3 | |
| HiPrune++Base Model=Qwen2.5-VL-7B, Token Budget=22.2%2025.08 | 73.2 | |
| SPprunerToken Retention Ratio=30%2026.05 | 73 | |
| FGVP-blurBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Blur background2025.10 | 72.3 | |
| DARTRatio=-62.1%, Backbone=Qwen2.5-VL-3B2026.05 | 72.24 | |
| ILLUMELLM=Vicuna-7B, Token Type=2D-Continuous, Res.=2242026.05 | 72.1 | |
| DARTToken Retention Ratio=30%2026.05 | 72 | |
| SpB2.0-VL-5BModel=SpB2.0-VL, Parameter Count=5B2026.04 | 71.72 | |
| Cambrain 8B# Vis tok.=5762025.04 | 71.7 | |
| CDPrunerRatio=-85.0%, Backbone=Qwen2.5-VL-3B2026.05 | 71.57 | |
| ChatVLA#Params=2B, Model Category=Vision-Language-Action Models, Co-training=true2026.05 | 71.2 | |
| HiPruneBase Model=Qwen2.5-VL-3B, Token Budget=33.3%2025.08 | 70.1 | |
| Visual-SR1Reasoning Paradigm=Text CoT2026.05 | 70.1 | |
| HiPrune++Base Model=Qwen2.5-VL-3B, Token Budget=33.3%2025.08 | 69.2 | |
| Florence-VL 3B# Vis tok.=5762025.04 | 69.1 | |
| SmolVLM2-2.2BModel=SmolVLM2, Parameter Count=2.2B2026.04 | 68.81 | |
| FastVToken Retention Ratio=70%2026.05 | 68.4 | |
| IVC-PruneRatio=-85.0%, Backbone=Qwen2.5-VL-3B2026.05 | 68.27 | |
| Qwen 2.5 VL 3BBase Model=Qwen 2.5 VL 3B, Resolution=-, Cropping Strategy=None2025.11 | 68.2 | |
| FastVToken Retention Ratio=50%2026.05 | 67.8 | |
| DARTRatio=-75.0%, Backbone=Qwen2.5-VL-3B2026.05 | 66.58 | |
| CoVTModel=CoVT2026.05 | 66.5 | |
| PruneSIDRatio=-62.1%, Backbone=Qwen2.5-VL-3B2026.05 | 65.89 | |
| BaselineBackbone=LLAMA3-LLAVA-NEXT-8B, Token multiplier=1.00×, Channel multiplier=1.00×, KV Cache budget multiplier=1.00×2026.05 | 65.4 | |
| FastVToken Retention Ratio=30%2026.05 | 65.3 | |
| Emu3LLM=8B (from scratch), Token Type=2D-Discrete, Res.=5122026.05 | 64.7 | |
| DART (ViT)ViT retain tokens=50%, LLM retain tokens=50%2026.04 | 63.6 |