Real-world Visual Question Answering on RealWorldQA
79.35AccuracyQwen 3.5
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen 3.5Zero-shot=true, Parameters=122B-A10B, Organization=Alibaba Cloud2026.05 | 79.35 | — | — | |
| Qwen3-VL-4B-MastersSize=4B2025.12 | 77.8 | — | — | |
| Qwen3-VL-8B-MastersSize=8B2025.12 | 77.5 | — | — | |
| Qwen2.5-VL-7B-MastersSize=7B2025.12 | 77.3 | — | — | |
| GPT-4o2024.12 | 75.4 | — | — | |
| InternVL3.5-8B-MastersSize=8B2025.12 | 74.9 | — | — | |
| InternVL3.5-38B + LoTModel Scale=Large, Framework=LoT, Visual Highlighting=true2026.04 | 74.9 | — | — | |
| InternVL3-8B-MastersSize=8B2025.12 | 74.8 | — | — | |
| BAGEL (Ours)Baseline=BAGEL, Params=7B active2026.06 | 73.9 | — | — | |
| Keye-VL-1.5-8BSize=8B2025.12 | 73.5 | — | — | |
| Ovis2-8BSize=8B2025.12 | 72.5 | — | — | |
| InternVL3.5-38BModel Scale=Large, Framework=Baseline, Visual Highlighting=false2026.04 | 72.5 | — | — | |
| Qwen2.5vl-InstructModel Scale=7B, Training Protocol=PSO, Category=Open-Source Reasoning MLLMs2025.12 | 72.3 | — | — | |
| LLaVA-OneVision# Parameters=72B2024.12 | 71.9 | — | — | |
| LLaVA-OneVisionModel Scale=72B, Category=Open-Source General MLLMs2025.12 | 71.9 | — | — | |
| InternVL2# Parameters=40B2024.12 | 71.8 | — | — | |
| CoVT2026.02 | 71.6 | — | — | |
| Qwen3-VL-4B + LoTModel Scale=Small, Framework=LoT, Visual Highlighting=true2026.04 | 71.6 | — | — | |
| GLM-4.5VZero-shot=true, Parameters=106B-A12B, Organization=Z.ai2026.05 | 71.38 | — | — | |
| BAGELBaseline=BAGEL, Params=7B active2026.06 | 71.2 | — | — | |
| Ovis2-4BSize=4B2025.12 | 71.1 | — | — | |
| VARGPT-v1.1 (Ours)Baseline=VARGPT-v1.1, Params=7B+2B2026.06 | 71.1 | — | — | |
| BLIP3o-8B (Ours)Baseline=BLIP3o-8B, Params=8B2026.06 | 70.9 | — | — | |
| Llama 4 MaverickZero-shot=true, Parameters=400B-A17B, Organization=MetaAI2026.05 | 70.85 | — | — | |
| InternVL3-8BSize=8B2025.12 | 70.8 | — | — | |
| Qwen2.5-VL-3B-MastersSize=3B2025.12 | 70.7 | — | — | |
| GLM-4.1V-9BSize=9B2025.12 | 70.6 | — | — | |
| Qwen3-VL-4BSize=4B2025.12 | 70.6 | — | — | |
| CrystaLBase Model=Qwen2.5-VL-7B2026.02 | 70.6 | — | — | |
| Baseline (No Recompute)Model=Qwen3-VL-8B, Recomputation budget (k)=02026.03 | 70.59 | — | — | |
| SKILA2026.02 | 70.5 | — | — | |
| Gemini 1.5 Pro2024.12 | 70.4 | — | — | |
| Qwen2.5vl-InstructModel Scale=7B, Training Protocol=SFT + GRPO, Category=Open-Source Reasoning MLLMs2025.12 | 70.2 | — | — | |
| Qwen2-VL# Parameters=8B2024.12 | 70.1 | — | — | |
| LLaVA-OneVision-7BSize=7B2025.12 | 69.9 | — | — | |
| Qwen3-VL-8BSize=8B2025.12 | 69.9 | — | — | |
| Qwen-2.5-VL-7B + EvoLMMsetting=zero-shot2025.11 | 69.9 | — | — | |
| NVLM-D-1.0# Parameters=78B2024.12 | 69.7 | — | — | |
| GPT-4o2026.02 | 69.7 | — | — | |
| NVILA# Parameters=15B2024.12 | 69.5 | — | — | |
| LIVR2026.02 | 69.2 | — | — | |
| MODIXSize=8B, Backbone=Qwen3-VL2026.04 | 69.15 | — | — | |
| Qwen3-VL-2B-MastersSize=2B2025.12 | 69 | — | — | |
| BLIP3o-8BBaseline=BLIP3o-8B, Params=8B2026.06 | 69 | — | — | |
| MODIXSize=3B, Backbone=LFM2-VL2026.04 | 68.76 | — | — | |
| Qwen-2.5-VL-7Bsetting=zero-shot2025.11 | 68.7 | — | — | |
| NVILA# Parameters=8B2024.12 | 68.6 | — | — | |
| Qwen2.5-VL-7BParameters=7B2026.02 | 68.6 | — | — | |
| Qwen2.5vl-InstructModel Scale=7B, Category=Open-Source Reasoning MLLMs2025.12 | 68.5 | — | — | |
| Qwen2.5-VL-7BSize=7B2025.12 | 68.5 | — | — | |
| InternVL3-2B-MastersSize=2B2025.12 | 68.4 | — | — | |
| LLaVA-OneVision-1.5-8BSize=8B2025.12 | 68.1 | — | — | |
| InternVL3.5-4B-MastersSize=4B2025.12 | 68.1 | — | — | |
| InternVL3.5-2B-MastersSize=2B2025.12 | 68.1 | — | — | |
| InfoFlow KVModel=Qwen3-VL-8B, Recomputation budget (k)=22026.03 | 68.1 | — | — | |
| MiniCPM-o2.6-8BSize=8B2025.12 | 68 | — | — | |
| Cambrian-1# Parameters=34B2024.12 | 67.8 | — | — | |
| LLaVA-OneVision-1.5-4BSize=4B2025.12 | 67.8 | — | — | |
| Keye-VL-8BSize=8B2025.12 | 67.7 | — | — | |
| LVR2026.02 | 67.7 | — | — | |
| CacheBlendModel=Qwen3-VL-8B, Recomputation budget (k)=22026.03 | 67.58 | — | — | |
| InternVL3.5-8BSize=8B2025.12 | 67.5 | — | — | |
| Qwen2.5-VL-7B + LoTModel Scale=Medium, Framework=LoT, Visual Highlighting=true2026.04 | 67.5 | — | — | |
| Qwen3-VL-8B + LoTModel Scale=Medium, Framework=LoT, Visual Highlighting=true2026.04 | 67.5 | — | — | |
| VARGPT-v1.1Baseline=VARGPT-v1.1, Params=7B+2B2026.06 | 67.5 | — | — | |
| No RecomputeModel=Qwen3-VL-8B, Recomputation budget (k)=22026.03 | 67.45 | — | — | |
| EPICModel=Qwen3-VL-8B, Recomputation budget (k)=22026.03 | 67.45 | — | — | |
| LFM2-VLSize=3B, Configuration=Baseline2026.04 | 67.32 | — | — | |
| Qwen2.5-VL-7BRatio=100%, Backbone=Qwen2.5-VL-7B2026.05 | 67.32 | — | — | |
| InternVL3.5-4B + LoTModel Scale=Small, Framework=LoT, Visual Highlighting=true2026.04 | 67.3 | — | — | |
| NVILA-Lite# Parameters=15B2024.12 | 67.1 | — | — | |
| Qwen2.5-VL-32B + LoTModel Scale=Large, Framework=LoT, Visual Highlighting=true2026.04 | 67.1 | — | — | |
| Qwen3-VLSize=8B, Configuration=Baseline2026.04 | 66.93 | — | — | |
| Qwen3-VL-8BModel Scale=Medium, Framework=Baseline, Visual Highlighting=false2026.04 | 66.8 | — | — | |
| Qwen3-VL-4BModel Scale=Small, Framework=Baseline, Visual Highlighting=false2026.04 | 66.7 | — | — | |
| InternVL3.5-4BModel Scale=Small, Framework=Baseline, Visual Highlighting=false2026.04 | 66.7 | — | — | |
| InfoFlow KVModel=Qwen3-VL-8B, Recomputation budget (k)=42026.03 | 66.67 | — | — | |
| V-GIFTModel=LLaVA-OneVision-1.52026.04 | 66.4 | — | — | |
| LLaVA-OneVision# Parameters=8B2024.12 | 66.3 | — | — | |
| LLaVA-OneVisionModel Scale=7B, Category=Open-Source General MLLMs2025.12 | 66.3 | — | — | |
| InternVL3.5-4BSize=4B2025.12 | 66.3 | — | — | |
| Phoenix-VL 1.5 MediumZero-shot=true, Parameters=123B, Organization=HTX2026.05 | 66.27 | — | — | |
| BaselineModel=LLaVA-OneVision-1.52026.04 | 66.1 | — | — | |
| Ovis2-2BSize=2B2025.12 | 66 | — | — | |
| InternVL3.5-8B + LoTModel Scale=Medium, Framework=LoT, Visual Highlighting=true2026.04 | 65.9 | — | — | |
| No RecomputeModel=Qwen3-VL-8B, Recomputation budget (k)=42026.03 | 65.88 | — | — | |
| MODIXSize=2B, Backbone=Qwen3-VL2026.04 | 65.75 | — | — | |
| CacheBlendModel=Qwen3-VL-8B, Recomputation budget (k)=42026.03 | 65.62 | — | — | |
| NVILA-Lite# Parameters=8B2024.12 | 65.6 | — | — | |
| Qwen2.5-VL-32BModel Scale=Large, Framework=Baseline, Visual Highlighting=false2026.04 | 65.6 | — | — | |
| EPICModel=Qwen3-VL-8B, Recomputation budget (k)=42026.03 | 65.49 | — | — | |
| Pixtral# Parameters=12B2024.12 | 65.4 | — | — | |
| Qwen2.5-VL-3BSize=3B2025.12 | 65.4 | — | — | |
| Qwen2VL-7B-Instruct + LUVCLatency=0.2335, Speedup=1.53x2025.12 | 65.23 | 76.52 | — | |
| Qwen2VL-7B-InstructLatency=0.35692025.12 | 65.1 | 77.38 | — | |
| MiniCPM-V2.6-8BSize=8B2025.12 | 65 | — | — | |
| Aquila-VL-2BSize=2B2025.12 | 65 | — | — | |
| Qwen2.5-VL-7BModel Scale=Medium, Framework=Baseline, Visual Highlighting=false2026.04 | 65 | — | — | |
| Qwen2-VL-7B + LoTModel Scale=Medium, Framework=LoT, Visual Highlighting=true2026.04 | 64.8 | — | — | |
| InternVL3.5-8BModel Scale=Medium, Framework=Baseline, Visual Highlighting=false2026.04 | 64.7 | — | — |