OCR Visual Question Answering on TextVQA
84.9AccuracyFP16 (Baseline)
Evaluation Results
| Method | Links | |
|---|---|---|
| FP16 (Baseline)Backbone=Qwen 2.5 VL 7B, Avg. Bit width=162025.09 | 84.9 | |
| AWQBackbone=Qwen 2.5 VL 7B, Avg. Bit width=42025.09 | 84.6 | |
| OmniQuantBackbone=Qwen 2.5 VL 7B, Avg. Bit width=42025.09 | 84.5 | |
| GPTQBackbone=Qwen 2.5 VL 7B, Avg. Bit width=42025.09 | 84.2 | |
| VanillaBackbone=Qwen2.5-VL-7B, Pruning Stage=N/A, Token Retention Rate=100%2026.01 | 83.69 | |
| CAPABackbone=Qwen2.5-VL-7B, Pruning Stage=Late, Token Retention Rate=25%2026.01 | 82.3 | |
| CAPABackbone=InternVL3-8B, Pruning Stage=Late, Token Retention Rate=25%2026.01 | 81.93 | |
| LUQBackbone=Qwen 2.5 VL 7B, Avg. Bit width=2.75, Quantized Layers=12 layer2025.09 | 81.9 | |
| VanillaBackbone=InternVL3-8B, Pruning Stage=N/A, Token Retention Rate=100%2026.01 | 80.89 | |
| InternVL3.5-38BModel Scale=Large, Framework=Baseline, Visual Highlighting=false2026.04 | 80.8 | |
| InternVL3.5-38B + LoTModel Scale=Large, Framework=LoT, Visual Highlighting=true2026.04 | 80.5 | |
| GPTQBackbone=Qwen 2.5 VL 7B, Avg. Bit width=32025.09 | 79.5 | |
| Qwen2-VL-7B + LoTModel Scale=Medium, Framework=LoT, Visual Highlighting=true2026.04 | 79.3 | |
| Qwen2-VL-7BModel Scale=Medium, Framework=Baseline, Visual Highlighting=false2026.04 | 78 | |
| InternVL3.5-8B + LoTModel Scale=Medium, Framework=LoT, Visual Highlighting=true2026.04 | 78 | |
| Qwen2.5-VL-7B + LoTModel Scale=Medium, Framework=LoT, Visual Highlighting=true2026.04 | 77.9 | |
| Qwen3-VL-8B + LoTModel Scale=Medium, Framework=LoT, Visual Highlighting=true2026.04 | 77.9 | |
| InternVL3.5-8BModel Scale=Medium, Framework=Baseline, Visual Highlighting=false2026.04 | 77.2 | |
| Qwen3-VL-8BModel Scale=Medium, Framework=Baseline, Visual Highlighting=false2026.04 | 76.9 | |
| InternVL2-8BModel=InternVL2-8B, Pruning Method=None2025.09 | 76.6 | |
| Qwen3-VL-4B + LoTModel Scale=Small, Framework=LoT, Visual Highlighting=true2026.04 | 76.5 | |
| PTPModel=InternVL2-8B, Pruning Method=PTP, Pruning Ratio (r)=0.5, Balancing Weight (alpha)=0.52025.09 | 76.4 | |
| TA w/ DAREmode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 76.3 | |
| TIES Mergingmode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 76.29 | |
| Task Arithmeticmode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 76.26 | |
| TIES w/ DAREmode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 76.19 | |
| SWUDImode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 76.04 | |
| InternVL3.5-4B + LoTModel Scale=Small, Framework=LoT, Visual Highlighting=true2026.04 | 76 | |
| SWUDI-Amode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 76 | |
| OptMergemode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 75.98 | |
| WUDI Mergingmode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 75.95 | |
| Qwen2.5-VL-7BModel Scale=Medium, Framework=Baseline, Visual Highlighting=false2026.04 | 75.7 | |
| TSV Mergingmode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 75.66 | |
| InternVL3.5-4BModel Scale=Small, Framework=Baseline, Visual Highlighting=false2026.04 | 75.5 | |
| Qwen2-VL-2B + LoTModel Scale=Small, Framework=LoT, Visual Highlighting=true2026.04 | 74.9 | |
| Qwen3-VL-4BModel Scale=Small, Framework=Baseline, Visual Highlighting=false2026.04 | 74.7 | |
| Weight Averagemode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 74.54 | |
| Qwen2.5-VL-32B + LoTModel Scale=Large, Framework=LoT, Visual Highlighting=true2026.04 | 74 | |
| MaLoRAModel=Qwen2.5-VL-7B, Training examples=34.6k2025.10 | 73.34 | |
| LoRAModel=Qwen2.5-VL-7B, Training examples=34.6k2025.10 | 73.3 | |
| MaLoRAModel=Qwen3-VL-8B, Training examples=34.6k2025.10 | 73.28 | |
| Mixture Trainingmode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 72.96 | |
| LoRAModel=Qwen3-VL-8B, Training examples=34.6k2025.10 | 72.94 | |
| InternVL2.5-Instructmode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 72.51 | |
| Qwen2.5-VL-32BModel Scale=Large, Framework=Baseline, Visual Highlighting=false2026.04 | 72.4 | |
| BaseModel=Qwen3-VL-8B, Training examples=34.6k2025.10 | 72.2 | |
| InternVL2-2BModel=InternVL2-2B, Pruning Method=None2025.09 | 72 | |
| PTPModel=InternVL2-2B, Pruning Method=PTP, Pruning Ratio (r)=0.5, Balancing Weight (alpha)=0.52025.09 | 72 | |
| Qwen2-VL-2BModel Scale=Small, Framework=Baseline, Visual Highlighting=false2026.04 | 72 | |
| QLoRAModel=Qwen3-VL-8B, Training examples=34.6k2025.10 | 71.52 | |
| QLoRAModel=Qwen2.5-VL-7B, Training examples=34.6k2025.10 | 71.26 | |
| BaseModel=Qwen2.5-VL-7B, Training examples=34.6k2025.10 | 71.14 | |
| Iso-Cmode=Full fine-tuning, backbone=InternVL2.5-1B2026.06 | 69.34 | |
| DragonflyLLM=Vicuna-7B, Resolution=2016 × 20162026.04 | 66.5 | |
| Qwen2.5-VL-3B + LoTModel Scale=Small, Framework=LoT, Visual Highlighting=true2026.04 | 66.4 | |
| LLaVA-NeXTLLM=Mistral-7B, Resolution=672 × 6722026.04 | 64.9 | |
| LLaVA-1.5-HDLLM=Vicuna-7B, Resolution=672 × 10242026.04 | 64 | |
| Qwen-VLLLM=Qwen-7B, Resolution=448 × 4482026.04 | 63.8 | |
| Qwen2.5-VL-3BModel Scale=Small, Framework=Baseline, Visual Highlighting=false2026.04 | 62.5 | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution=448 × 4482026.04 | 61.5 | |
| VIFLLM=Vicuna-7B, Resolution=336 × 3362026.04 | 59.9 | |
| IGVALLM=Vicuna-7B, Resolution=336 × 3362026.04 | 59.4 | |
| DenseConnectorLLM=Vicuna-7B2026.04 | 59.2 | |
| MMFuserLLM=Vicuna-7B2026.04 | 58.8 | |
| FP16 (Baseline)Backbone=LLaVA-1.5 7B, Avg. Bit width=162025.09 | 58.2 | |
| LLaVA-v1.5LLM=Vicuna-7B, Resolution=336 × 3362026.04 | 58.1 | |
| GPTQBackbone=LLaVA-1.5 7B, Avg. Bit width=42025.09 | 56.8 | |
| AWQBackbone=LLaVA-1.5 7B, Avg. Bit width=42025.09 | 56.7 | |
| mPLUG-Owl2LLM=LLaMA 2-7B, Resolution=448 × 4482026.04 | 54.3 | |
| GPTQBackbone=LLaVA-1.5 7B, Avg. Bit width=32025.09 | 54.1 | |
| LUQBackbone=LLaVA-1.5 7B, Avg. Bit width=2.54, Quantized Layers=16 layer2025.09 | 53.4 | |
| LLaVA with ViCropLLM=Vicuna-7B, Resolution=336 × 3362026.04 | 51.7 | |
| MaLoRAModel=LLaVA-1.5-7B, Training examples=34.6k2025.10 | 50.56 | |
| LoRAModel=LLaVA-1.5-7B, Training examples=34.6k2025.10 | 50.24 | |
| InstructBLIPLLM=Vicuna-7B, Resolution=224 × 2242026.04 | 50.1 | |
| QLoRAModel=LLaVA-1.5-7B, Training examples=34.6k2025.10 | 50 | |
| Mantis-8B-FuyuLLM=Fuyu-8B, Resolution=1024 × 10242026.04 | 49 | |
| VanillaBackbone=LLaVA-1.5-7B, Pruning Stage=N/A, Token Retention Rate=100%2026.01 | 48.64 | |
| CAPABackbone=LLaVA-1.5-7B, Pruning Stage=Late, Token Retention Rate=25%2026.01 | 48.38 | |
| BaseModel=LLaVA-1.5-7B, Training examples=34.6k2025.10 | 47.8 | |
| OmniQuantBackbone=Qwen 2.5 VL 7B, Avg. Bit width=32025.09 | 41.3 | |
| BiLLMBackbone=Qwen 2.5 VL 7B, Avg. Bit width=1.082025.09 | 26.3 | |
| IDEFICS-9BLLM=LLaMA 2-7B2026.04 | 25.9 | |
| SlimLLMBackbone=LLaVA-1.5 7B, Avg. Bit width=42025.09 | 25.2 | |
| SlimLLMBackbone=LLaVA-1.5 7B, Avg. Bit width=32025.09 | 22.3 | |
| OmniQuantBackbone=LLaVA-1.5 7B, Avg. Bit width=42025.09 | 21 | |
| OmniQuantBackbone=LLaVA-1.5 7B, Avg. Bit width=32025.09 | 16.8 | |
| BiLLMBackbone=LLaVA-1.5 7B, Avg. Bit width=1.082025.09 | 15.6 |