Infographic Visual Question Answering on InfoVQA
84.1AccuracyQwen3-VL-8B-Thinking
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VL-8B-ThinkingStrategy=LongCoT2026.02 | 84.1 | |
| SAPStrategy=SAP2026.02 | 83.1 | |
| Qwen3-VL-8B-InstructStrategy=Instruct2026.02 | 82.6 | |
| Qwen2.5-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 82.6 | |
| RADIO1DTokens per frame/tile=256, TTFT (ms)=452.8, LLM Backbone=9B Nemotron2026.07 | 78.6 | |
| LLaVA next 8B# Vis tok.=28802024.12 | 78.2 | |
| C-RADIOv4-HTokens per frame/tile=256, TTFT (ms)=468.2, LLM Backbone=9B Nemotron2026.07 | 77.8 | |
| SigLIP2-gTokens per frame/tile=256, TTFT (ms)=517.6, LLM Backbone=9B Nemotron2026.07 | 77.8 | |
| SigLIP2-SO400mTokens per frame/tile=256, TTFT (ms)=440.5, LLM Backbone=9B Nemotron2026.07 | 77.7 | |
| InternVL2.5Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 77.6 | |
| RADIO1DTokens per frame/tile=224, TTFT (ms)=410.2, LLM Backbone=9B Nemotron2026.07 | 77.3 | |
| Qwen2.5-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 77.1 | |
| InternVL3Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 76.8 | |
| Qwen2-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 76.5 | |
| RADIO1DTokens per frame/tile=192, TTFT (ms)=380.4, LLM Backbone=9B Nemotron2026.07 | 75.6 | |
| Encoder-BasedInput=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 75 | |
| RADIO1DTokens per frame/tile=128, TTFT (ms)=373.2, LLM Backbone=9B Nemotron2026.07 | 72.6 | |
| RADIO1DTokens per frame/tile=64, TTFT (ms)=346.1, LLM Backbone=9B Nemotron2026.07 | 67.7 | |
| InternVL3Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 66.1 | |
| Encoder-BasedInput=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 65.9 | |
| Qwen2-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 65.5 | |
| CapRL-Image-5MModel Configuration=Qwen2.5-7B + Qwen2.5-ViT2026.06 | 63.4 | |
| NEOInput=Any Res., RoPE=Native-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 63.2 | |
| RADIO1DTokens per frame/tile=32, TTFT (ms)=335.1, LLM Backbone=9B Nemotron2026.07 | 62.7 | |
| CapRL-Image-5MModel Configuration=Qwen2.5-3B + Qwen2.5-ViT2026.06 | 61.5 | |
| InternVL2.5Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 60.9 | |
| NEOInput=Any Res., RoPE=Native-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 60.9 | |
| CapRL-Image-1MModel Configuration=Qwen2.5-7B + Qwen2.5-ViT2026.06 | 59.9 | |
| OptMergeBackbone=InternVL2.5-1B2026.06 | 56.84 | |
| SWUDI-ABackbone=InternVL2.5-1B2026.06 | 56.57 | |
| OneCATInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 56.3 | |
| CapRL-Image-1MModel Configuration=Qwen2.5-3B + Qwen2.5-ViT2026.06 | 56.2 | |
| HoVLEInput=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 55.7 | |
| DenseFusion-1MModel Configuration=Qwen2.5-7B + Qwen2.5-ViT2026.06 | 53.5 | |
| RADIO1DTokens per frame/tile=8, TTFT (ms)=329.7, LLM Backbone=9B Nemotron2026.07 | 53.2 | |
| Florence-VL 8B# Vis tok.=5762024.12 | 51.7 | |
| Florence-VL 3B# Vis tok.=5762024.12 | 51.3 | |
| FlorenceVL-3BVision Encoder=DaViT, LLM=Phi-3, #Visual Tokens=576, Vis. Enc. Size (M)=770, Evaluation Library=lmms-eval2024.12 | 51.3 | |
| MM1.5-1BVision Encoder=ViT-H, #Visual Tokens=1440, Vis. Enc. Size (M)=632, Evaluation Library=lmms-eval2024.12 | 50.5 | |
| ShareGPT4V-1MModel Configuration=Qwen2.5-7B + Qwen2.5-ViT2026.06 | 49.8 | |
| FastVLM-1.7BVision Encoder=FastViTHD, LLM=Qw.2, #Visual Tokens=256, Vis. Enc. Size (M)=125, Evaluation Library=lmms-eval2024.12 | 49.6 | |
| DenseFusion-1MModel Configuration=Qwen2.5-3B + Qwen2.5-ViT2026.06 | 49.4 | |
| Mono-InternVL-1.5Input=Tile-wise, RoPE=1D-RoPE, Backbone=DaC, Parameter Scale=2B2025.10 | 47.9 | |
| VanillaModel Configuration=Qwen2.5-7B + Qwen2.5-ViT2026.06 | 47.6 | |
| CapRL-Image-5MModel Configuration=InternLM2.5-7B + CLIP-ViT-L2026.06 | 47 | |
| ShareGPT4V-1MModel Configuration=Qwen2.5-3B + Qwen2.5-ViT2026.06 | 46.1 | |
| VanillaModel Configuration=Qwen2.5-3B + Qwen2.5-ViT2026.06 | 43.9 | |
| Emu3Input=Fix Res., RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 43.8 | |
| FastVLM-0.6BVision Encoder=FastViTHD, LLM=Qw.2, #Visual Tokens=256, Vis. Enc. Size (M)=125, Evaluation Library=lmms-eval2024.12 | 43.3 | |
| CapRL-Image-1MModel Configuration=InternLM2.5-7B + CLIP-ViT-L2026.06 | 43.3 | |
| Mono-InternVLInput=Tile-wise, RoPE=1D-RoPE, Backbone=MoE, Parameter Scale=2B2025.10 | 43 | |
| Individual OCRBackbone=InternVL2.5-1B2026.06 | 41.97 | |
| Phi 3.5 Vision2024.12 | 40.7 | |
| DenseFusion-1MModel Configuration=InternLM2.5-7B + CLIP-ViT-L2026.06 | 39.3 | |
| Individual VQABackbone=InternVL2.5-1B2026.06 | 39.07 | |
| ShareGPT4V-1MModel Configuration=InternLM2.5-7B + CLIP-ViT-L2026.06 | 38.9 | |
| SmolVLM2-2.2BVision Encoder=ViT-SO400M, LLM=SmolLM2, #Visual Tokens=2106*, Vis. Enc. Size (M)=430, Evaluation Library=lmms-eval2024.12 | 37.8 | |
| RADIO1DTokens per frame/tile=1, TTFT (ms)=327.0, LLM Backbone=9B Nemotron2026.07 | 37.8 | |
| VanillaModel Configuration=InternLM2.5-7B + CLIP-ViT-L2026.06 | 37.4 | |
| MaD-MixModel size=7B, Evaluation protocol=0-shot2026.02 | 35.89 | |
| UniformModel size=7B, Evaluation protocol=0-shot2026.02 | 35.74 | |
| AvgModel size=7B, Evaluation protocol=0-shot2026.02 | 34.65 | |
| FusedModel size=7B, Evaluation protocol=0-shot2026.02 | 34.4 | |
| Individual GroundingBackbone=InternVL2.5-1B2026.06 | 33.82 | |
| Individual GeometryBackbone=InternVL2.5-1B2026.06 | 29.79 | |
| ICONSTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 27.5 | |
| PerplexityTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 27.1 | |
| MAGICTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 26.9 | |
| SemDeDupTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 26.6 | |
| Full-FinetuneTraining Budget=100%, Backbone=LLaVA-1.5-13B2026.05 | 26.5 | |
| EL2NTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 26.4 | |
| Individual ChartBackbone=InternVL2.5-1B2026.06 | 26.02 | |
| COINCIDETraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 26 | |
| SmolVLM2-0.5BVision Encoder=ViT-B, LLM=SmolLM2, #Visual Tokens=1088*, Vis. Enc. Size (M)=93, Evaluation Library=VLMEvalKit2024.12 | 25.5 | |
| RDSTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 25.4 | |
| Self-SupTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 25.2 | |
| EVEInput=Any Rat., RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 25 | |
| Self-FilterTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 25 | |
| CLIP-ScoreTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 24.9 | |
| D2-PruningTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 24.7 | |
| RandomTraining Budget=20%, Backbone=LLaVA-1.5-13B2026.05 | 24.3 | |
| MaD-MixModel size=0.5B, Evaluation protocol=0-shot2026.02 | 22.4 | |
| AvgModel size=0.5B, Evaluation protocol=0-shot2026.02 | 21.97 | |
| UniformModel size=0.5B, Evaluation protocol=0-shot2026.02 | 21.65 | |
| FusedModel size=0.5B, Evaluation protocol=0-shot2026.02 | 21.17 | |
| ChameleonInput=Fix Res., RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 5 |