Chart Question Answering on ChartQA (test)
95.3AccuracyGenRecal
Evaluation Results
| Method | Links | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GenRecalstudent=Qwen2-VL-7B, teacher=InternVL2.5-78B2025.06 | 95.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MiMo-VL-7B-SFT-2508Judge=GPT-4o2025.12 | 93.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MiMo-VL-Miloco-7BJudge=GPT-4o2025.12 | 92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Claude 3.5Chain-of-Thought (CoT)=true2024.07 | 90.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Claude 3.5 Sonnet2024.12 | 90.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Claude-3.5 Sonnet2026.04 | 90.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BJudge=GPT-4o2025.12 | 90.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3-8BJudge=GPT-4o2025.12 | 89.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B + Saliency-R1Training Stage=Saliency-R12026.04 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5VLSize=7B, Type=AR, Samples=>9M2025.12 | 87.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini-1.5-ProModel Scale=High-End2024.09 | 87.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini 1.5 ProChain-of-Thought (CoT)=true2024.07 | 87.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini-1.5-Pro2024.12 | 87.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini 1.5 Pro2024.12 | 87.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B + SFTTraining Stage=SFT2026.04 | 87.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NVILA# Parameters=15B2024.12 | 86.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2# Parameters=40B2024.12 | 86.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NVILA# Parameters=8B2024.12 | 86.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NVLM-D-1.0# Parameters=78B2024.12 | 86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama 3-V 405BChain-of-Thought (CoT)=true2024.07 | 85.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oModel Scale=High-End2024.09 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oChain-of-Thought (CoT)=true2024.07 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4o2024.12 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4o2024.12 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4o2026.04 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B + Q-ZoomThroughput=0.81×, Maximum visual tokens=5762026.04 | 85.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama 3.2# Parameters=90B2024.12 | 85.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B + SD-RPNThroughput=0.50×, Maximum visual tokens=5762026.04 | 85.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-4B + Q-ZoomThroughput=0.82×, Maximum visual tokens=5762026.04 | 85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NVILA-Lite# Parameters=8B2024.12 | 84.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2.5size=8B2025.06 | 84.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL-2-26BModel=InternVL-2-26B2026.01 | 84.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DiffusionVLSize=7B, Type=Diff., Samples=738K2025.12 | 84.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3B + Saliency-R1Training Stage=Saliency-R12026.04 | 84.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PVC InternVL2 (Ours)Size=8B, #token /image tile=642024.12 | 84.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3B + Q-ZoomThroughput=0.73×, Maximum visual tokens=5762026.04 | 84.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8B-Instruct + DUPLModel Size=8B, Optimization=DUPL2025.10 | 84.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5VLSize=3B, Type=AR, Samples=>9M2025.12 | 84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3B + SFTTraining Stage=SFT2026.04 | 84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BTraining Stage=Base2026.04 | 84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-4BThroughput=1.0×, Maximum visual tokens=5762026.04 | 84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-4B + SD-RPNThroughput=0.63×, Maximum visual tokens=5762026.04 | 84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mulberry-7B2026.04 | 83.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Vision-R1-LlamaV-CI-11B2026.04 | 83.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL 1.5#param=26B, open-source=false2024.04 | 83.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3B + SD-RPNThroughput=0.49×, Maximum visual tokens=5762026.04 | 83.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision# Parameters=72B2024.12 | 83.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM1.5-30BModel Scale=30B2024.09 | 83.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3BTraining Stage=Base2026.04 | 83.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama 3.2# Parameters=11B2024.12 | 83.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2Size=8B, #token /image tile=2562024.12 | 83.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2# Parameters=8B2024.12 | 83.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Phi-4-reasoning-vision-15BThinking Mode=default2026.03 | 83.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama 3-V 70BChain-of-Thought (CoT)=true2024.07 | 83.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-VL-InstructLLM=Qwen2-7B, Vision Encoder=DFN-CLIP-H2024.12 | 83 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-VLSize=7B, #token /image tile=Native resolution (unfixed)2024.12 | 83 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-VL# Parameters=8B2024.12 | 83 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-Reasoner-8B2026.04 | 83 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BThroughput=1.0×, Maximum visual tokens=5762026.04 | 83 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Phi-4-reasoning-vision-15BThinking Mode=force thinking2026.03 | 82.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-4B-Instruct + DUPLModel Size=4B, Optimization=DUPL2025.10 | 82.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL-2-8BModel=InternVL-2-8B2026.01 | 82.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MiniCPM-V-2.6-8B2026.04 | 82.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3BThroughput=1.0×, Maximum visual tokens=5762026.04 | 82.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IXC-2.5Size=7B, #token /image tile=4002024.12 | 82.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IXC-2.52026.04 | 82.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8B-Instruct + GRPOModel Size=8B, Optimization=GRPO2025.10 | 82.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pixtral# Parameters=12B2024.12 | 81.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NVILA-Lite# Parameters=15B2024.12 | 81.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Claude-3 Haikuopen-source=false2024.04 | 81.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-4B-Instruct + GRPOModel Size=4B, Optimization=GRPO2025.10 | 81.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Insight-V-8B2026.04 | 81.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Phi-3-Vision-4BModel Scale=4B2024.09 | 81.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini Pro 1.5open-source=false2024.04 | 81.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ChartPaLIpretrained dataset=10B-WebLI, data=instruction data for charts2024.11 | 81.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IXC-2.5-7BModel=IXC-2.5-7B2026.01 | 81.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Claude-3 Sonnetopen-source=false2024.04 | 81.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision-7B2026.04 | 80.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini Ultra 1.0open-source=false2024.04 | 80.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Claude-3 Opusopen-source=false2024.04 | 80.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OVLLM=Qwen2-7B, Vision Encoder=SigLIP-SO400M2024.12 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OVSize=7B, #token /image tile=7292024.12 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision# Parameters=8B2024.12 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OVSize=7B, Type=AR, Samples=7.8M2025.12 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DiffusionVLSize=3B, Type=Diff., Samples=738K2025.12 | 79.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-Maxopen-source=false2024.04 | 79.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8B-InstructModel Size=8B2025.10 | 79.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-4B-InstructModel Size=4B2025.10 | 79.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-VL-72B-ThinkingMax Output Tokens=40K2026.03 | 79.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PVC InternVL2 (Ours)Size=2B, #token /image tile=642024.12 | 78.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OV (SI)LLM=Qwen2-7B, Vision Encoder=SigLIP-SO400M2024.12 | 78.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama 3-V 8BChain-of-Thought (CoT)=true2024.07 | 78.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OV-7B w/ CLIModel=LLaVA-OV-7B w/ CLI2026.01 | 78.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM1.5-7BModel Scale=7B2024.09 | 78.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-VL-7B-ThinkingMax Output Tokens=40K2026.03 | 78.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4Vopen-source=false2024.04 | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4VModel Scale=High-End2024.09 | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4V2024.12 | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OV-7BModel=LLaVA-OV-7B2026.01 | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-VL-72B-ThinkingMax Output Tokens=4K2026.03 | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — |