Visual Question Answering on DocVQA
94.9AccuracyQwen2.5-VL-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Token Retention Ratio=100%2025.12 | 94.9 | — | |
| Qwen3-VL-4BModel=Qwen3-VL, Parameter Count=4B2026.04 | 94.73 | — | |
| BaselineBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=1.00×, Channel multiplier=1.00×, KV Cache budget multiplier=1.00×2026.05 | 94.4 | — | |
| Penguin-VLParameters=2B2026.03 | 94.1 | — | |
| Qwen3-VLParameters=2B2026.03 | 93.3 | — | |
| BaseRatio=100%, Backbone=Qwen2.5-VL-3B2026.05 | 93.07 | — | |
| Qwen2.5-VL-3BModel=Qwen2.5-VL, Parameter Count=3B2026.04 | 93.01 | — | |
| DivPrune + RandomBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 92.9 | — | |
| QwenVL2.5-3BModel size=3B2026.05 | 92.85 | — | |
| CropVLMReward=Accuracy, Backbone=Qwen 2.5 VL, Input Resolution=1792x1792, CropVLM Resolution=2048x20482025.11 | 92.83 | — | |
| CropVLMReward=LL, Backbone=Qwen 2.5 VL, Input Resolution=1792x1792, CropVLM Resolution=2048x20482025.11 | 92.83 | — | |
| BalCapRL-3BBackbone=QwenVL2.5-3B2026.05 | 92.78 | — | |
| DivPruneBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 92.7 | — | |
| Qwen 2.5 VLInput Resolution=1792x17922025.11 | 92.5 | — | |
| FastVtoken ratio=64%2024.12 | 92.2 | 99.84 | |
| InternVL2-26Btoken ratio=100%2024.12 | 92.14 | 100 | |
| SGPtoken ratio=64%2024.12 | 92.12 | 100.14 | |
| InfiniteVL-4BModel=InfiniteVL, Parameter Count=4B, Result Source=InfiniteVL (Tao et al., 2025) paper2026.04 | 91.7 | — | |
| ERASERatio=-62.1%, Backbone=Qwen2.5-VL-3B2026.05 | 91.32 | — | |
| VisionZip + RotateKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.45×, Channel multiplier=0.25×, KV Cache budget multiplier=0.28×2026.05 | 91.29 | — | |
| SGPtoken ratio=35%2024.12 | 91.14 | 98.36 | |
| IVC-PruneRatio=-62.1%, Backbone=Qwen2.5-VL-3B2026.05 | 90.96 | — | |
| CapRL-3BBackbone=QwenVL2.5-3B2026.05 | 90.18 | — | |
| RubiCap-3BBackbone=QwenVL2.5-3B2026.05 | 90.15 | — | |
| DivPrune+VTWBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 89.8 | — | |
| ERASERatio=-75.0%, Backbone=Qwen2.5-VL-3B2026.05 | 89.68 | — | |
| Direct Fine-tuning (r=1)Optimization steps=+0 steps2026.02 | 89.63 | — | |
| In-Squeeze (128 ... -> 1)Optimization mode=Standard2026.02 | 89.58 | — | |
| Direct Fine-tuning (r=1)Optimization steps=+200 steps2026.02 | 89.52 | — | |
| In-Squeeze (128 ... -> 1)Optimization mode=Min steps2026.02 | 89.52 | — | |
| Direct Fine-tuning (r=1)Optimization steps=+700 steps2026.02 | 89.44 | — | |
| Cont-Squeeze (128 -> 1)Optimization steps=+200 steps2026.02 | 89.44 | — | |
| InternVL3.5Parameters=2B2026.03 | 89.4 | — | |
| DART + RandomBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 89.3 | — | |
| Cont-Squeeze (128 -> 1)Optimization steps=+700 steps2026.02 | 89.22 | — | |
| Qwen2-VLnumber of parameters=1.5B2025.07 | 88.6 | — | |
| DARTBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 88.5 | — | |
| IVC-PruneRatio=-75.0%, Backbone=Qwen2.5-VL-3B2026.05 | 88.11 | — | |
| Eagle2number of parameters=1.5B2025.07 | 88 | — | |
| FastV + RotateKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.40×, Channel multiplier=0.25×, KV Cache budget multiplier=0.25×2026.05 | 87.28 | — | |
| SGPtoken ratio=9%2024.12 | 87.26 | 89.58 | |
| LLaVA-OneVision-7BModel=LLaVA-OneVision, Parameter Count=7B2026.04 | 86.98 | — | |
| SpB2.0-VL-5BModel=SpB2.0-VL, Parameter Count=5B2026.04 | 86.9 | — | |
| DART+VTWBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 86.5 | — | |
| InstructVLA-Generalistnumber of parameters=1.5B, robot state=true2025.07 | 86 | — | |
| InternVL2-2Btoken ratio=100%2024.12 | 85.93 | 87.25 | |
| ShareGPT5V-mini-SFTTraining=SFT2026.05 | 85.92 | — | |
| VisionZip + ThinKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.45×, Channel multiplier=0.25×, KV Cache budget multiplier=0.28×2026.05 | 85.83 | — | |
| InstructVLA-Generalistnumber of parameters=1.5B2025.07 | 85.8 | — | |
| VisionZip (token only)Backbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.28×, Channel multiplier=1.00×, KV Cache budget multiplier=0.28×2026.05 | 84.71 | — | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=2048, Cropping Strategy=CropVLM2025.11 | 84.41 | — | |
| MoVALLM=Hermes-Yi-34B, Params=38B, Model Type=Specialist2024.04 | 84.2 | — | |
| ERASERatio=-85.0%, Backbone=Qwen2.5-VL-3B2026.05 | 83.89 | — | |
| DARTRatio=-62.1%, Backbone=Qwen2.5-VL-3B2026.05 | 83.55 | — | |
| PruneSIDRatio=-62.1%, Backbone=Qwen2.5-VL-3B2026.05 | 83.5 | — | |
| MoVALLM=Llama3-8B, Params=11B, Model Type=Specialist2024.04 | 83.4 | — | |
| ChatVLAnumber of parameters=1.5B2025.07 | 83.3 | — | |
| Qwen-VL-Plus2024.06 | 82.2 | — | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=1024, Cropping Strategy=CropVLM2025.11 | 82.1 | — | |
| FastV + ThinKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.40×, Channel multiplier=0.25×, KV Cache budget multiplier=0.25×2026.05 | 81.74 | — | |
| CogAgentLLM=Vicuna-7B, Params=18B, Model Type=Generalist2024.04 | 81.6 | — | |
| CogAgentModel Category=generalist models2023.12 | 81.6 | — | |
| LongVAResolution Strategy=AnyRes2024.06 | 81.5 | — | |
| D.P.Data Source Type=Real Data Reweighting, Sampling Strategy Category=Ours, Compute Budget=280K datapoints2026.03 | 81.4 | — | |
| LLaVA-NeXT-Qwen22024.06 | 81.3 | — | |
| MoVALLM=Vicuna-7B, Params=10B, Model Type=Specialist2024.04 | 81.3 | — | |
| CDPrunerRatio=-62.1%, Backbone=Qwen2.5-VL-3B2026.05 | 81.01 | — | |
| LongVAResolution Strategy=UniRes2024.06 | 80.8 | — | |
| OracleData Source Type=Real Data Reweighting, Sampling Strategy Category=Gold, Compute Budget=280K datapoints2026.03 | 80.4 | — | |
| Gemma 3 4B ITZero-shot=true2026.02 | 80.3 | — | |
| LEO2025.01 | 80.1 | — | |
| PALI-X-55BParams=55B, Model Type=Specialist2024.04 | 80 | — | |
| PALI-X-55BModel Category=task-specific fine-tuning models2023.12 | 80 | — | |
| SmolVLM2Parameters=2.2B2026.03 | 80 | — | |
| ToMetoken ratio=64%2024.12 | 79.51 | 94.24 | |
| ICONSData Source Type=Real Data Reweighting, Sampling Strategy Category=Baseline, Compute Budget=280K datapoints2026.03 | 79.4 | — | |
| Gemma3n E2B-itParameters=E2B-it, Inference template=Penguin's template2026.03 | 78.4 | — | |
| IVC-PruneRatio=-85.0%, Backbone=Qwen2.5-VL-3B2026.05 | 78.3 | — | |
| LLaVA-NeXT-LLaMA32024.06 | 78.2 | — | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=512, Cropping Strategy=CropVLM2025.11 | 77.88 | — | |
| Cont-Squeeze (128 -> 1)Optimization steps=+0 steps2026.02 | 77.86 | — | |
| UniformData Source Type=Real Data Reweighting, Sampling Strategy Category=Baseline, Compute Budget=280K datapoints2026.03 | 76.9 | — | |
| Pix2Struct-LargeParams=1.3B, Model Type=Specialist2024.04 | 76.6 | — | |
| Pix2StructModel Category=task-specific fine-tuning models2023.12 | 76.6 | — | |
| LLaVA-OVBackbone=LLaVA-OV 1.5B, Avg. FLOPs Savings=1.0×2026.03 | 76.6 | — | |
| Vary-baseLLM=Qwen-7B, Params=7B, Model Type=Generalist2024.04 | 76.3 | — | |
| VISORBackbone=LLaVA-OV 1.5B, Avg. FLOPs Savings=6.6×2026.03 | 75.3 | — | |
| CDPrunerRatio=-75.0%, Backbone=Qwen2.5-VL-3B2026.05 | 75.13 | — | |
| FastV (token only)Backbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.25×, Channel multiplier=1.00×, KV Cache budget multiplier=0.25×2026.05 | 75.04 | — | |
| AVG-LLaVALLM=Vicuna-7B, Resolution=High-resolution2024.09 | 74.6 | — | |
| 16-bit BaselineData Format=16-bit, Backbone=LLaVA1.6-7B2024.11 | 74.46 | — | |
| LLaVA-NeXTLLM=Vicuna-7B, Resolution=High-resolution2024.09 | 74.4 | — | |
| LLaVA-1.6-Vicuna2024.06 | 74.4 | — | |
| PaliGemmanumber of parameters=2B2025.07 | 74 | — | |
| DARTRatio=-75.0%, Backbone=Qwen2.5-VL-3B2026.05 | 72.85 | — | |
| LLaVA-NeXT-M3LLM=Vicuna-7B, Resolution=High-resolution2024.09 | 72.6 | — | |
| BaselineBackbone=LLAMA3-LLAVA-NEXT-8B, Token multiplier=1.00×, Channel multiplier=1.00×, KV Cache budget multiplier=1.00×2026.05 | 72.44 | — | |
| PruneSIDRatio=-75.0%, Backbone=Qwen2.5-VL-3B2026.05 | 72.2 | — | |
| SmolVLM2-2.2BModel=SmolVLM2, Parameter Count=2.2B2026.04 | 70.75 | — | |
| Qwen 2.5 VL 3BBase Model=Qwen 2.5 VL 3B, Resolution=-, Cropping Strategy=None2025.11 | 69.52 | — |