Visual Question Answering on InfoVQA (val)
87.9AccuracyConFoThinking (Qwen3-VL-8B)
Evaluation Results
| Method | Links | |
|---|---|---|
| ConFoThinking (Qwen3-VL-8B)Backbone=Qwen3-VL-8B2026.02 | 87.9 | |
| ConFoThinking (Qwen3-VL-4B)Backbone=Qwen3-VL-4B2026.02 | 86.4 | |
| Qwen3-VLparameters=8B2026.01 | 83.13 | |
| Qwen3-VL-8B (with tools)Backbone=Qwen3-VL-8B, Thinking Tools=true2026.02 | 83.1 | |
| Baseline (No Recompute)Model=Qwen3-VL-8B, Recomputation budget (k)=02026.03 | 83.07 | |
| MiMo-VLtraining=7B-SFT, parameters=7B2026.01 | 83.04 | |
| MiMo-VLtraining=7B-RL, parameters=7B2026.01 | 82.92 | |
| ConFoThinking (Qwen2.5-VL-7B)Backbone=Qwen2.5-VL-7B2026.02 | 82.1 | |
| Qwen3-VL-8BBackbone=Qwen3-VL-8B2026.02 | 81.7 | |
| Qwen3-VL-4B (with tools)Backbone=Qwen3-VL-4B, Thinking Tools=true2026.02 | 81.1 | |
| Pixel-Reasoner2026.02 | 79.8 | |
| Qwen2.5-VL-7B + Q-ZoomThroughput=0.81×, Maximum visual tokens=5762026.04 | 79.4 | |
| Innovator-VLvariant=8B-Instruct, parameters=8B2026.01 | 79.37 | |
| Qwen3-VL-4BBackbone=Qwen3-VL-4B2026.02 | 79.3 | |
| InternVL3.5-8BBackbone=InternVL3.5-8B2026.02 | 79.2 | |
| LLaVA-OVversion=1.5, parameters=8B2026.01 | 79.03 | |
| Innovator-VLvariant=8B-Thinking, parameters=8B2026.01 | 78.11 | |
| LLaVA-OneVision-1.5-8BBackbone=LLaVA-OneVision-1.5-8B2026.02 | 78.1 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.02 | 77.9 | |
| Qwen3-VL-4B + Q-ZoomThroughput=0.82×, Maximum visual tokens=5762026.04 | 77.1 | |
| Qwen2.5-VL-7B + SD-RPNThroughput=0.50×, Maximum visual tokens=5762026.04 | 76.9 | |
| InternVL2.5-MPO2025.01 | 76.2 | |
| ZoomEye2026.02 | 76.2 | |
| Qwen2-VL2025.01 | 75.9 | |
| InternVL2.52025.01 | 75.5 | |
| Qwen3-VL-4B + SD-RPNThroughput=0.63×, Maximum visual tokens=5762026.04 | 75.4 | |
| SAIL-VL-8B2025.01 | 75.2 | |
| Intern-S1variant=mini, parameters=9B2026.01 | 75.16 | |
| Visual Sketchpad2026.02 | 75.1 | |
| InternVL3.5parameters=8B2026.01 | 74.71 | |
| Qwen2.5-VL-3B + Q-ZoomThroughput=0.73×, Maximum visual tokens=5762026.04 | 74.5 | |
| InfoFlow KVModel=Qwen3-VL-8B, Recomputation budget (k)=22026.03 | 73.07 | |
| DeepSeekVL-2-Small2025.01 | 72.5 | |
| MiniCPM-Vversion=4.5, parameters=8B2026.01 | 72.14 | |
| CacheBlendModel=Qwen3-VL-8B, Recomputation budget (k)=22026.03 | 72 | |
| Qwen3-VL-2BParameter Count=2B, Evaluation Toolkit=VLMEvalKit2025.12 | 71.9 | |
| No RecomputeModel=Qwen3-VL-8B, Recomputation budget (k)=22026.03 | 71.64 | |
| jina-vlm2025.12 | 71.6 | |
| EPICModel=Qwen3-VL-8B, Recomputation budget (k)=22026.03 | 71.51 | |
| SEAL2026.02 | 70.2 | |
| Qwen2.5-VL-7BThroughput=1.0×, Maximum visual tokens=5762026.04 | 70.1 | |
| InternVL3.5-2BParameter Count=2B, Evaluation Toolkit=VLMEvalKit2025.12 | 69.3 | |
| Qwen3-VL-4BThroughput=1.0×, Maximum visual tokens=5762026.04 | 68 | |
| InternVL3-2BParameter Count=2B, Evaluation Toolkit=VLMEvalKit2025.12 | 67.1 | |
| Qwen2.5-VL-3B + SD-RPNThroughput=0.49×, Maximum visual tokens=5762026.04 | 67 | |
| LLaDA-VModel Architecture Style=Diff. Based2026.03 | 66.3 | |
| Qwen2-VL-2BParameter Count=2B, Evaluation Toolkit=VLMEvalKit2025.12 | 64 | |
| Qwen2.5-VL-3BThroughput=1.0×, Maximum visual tokens=5762026.04 | 62.4 | |
| InfoFlow KVModel=Qwen3-VL-8B, Recomputation budget (k)=42026.03 | 62.23 | |
| InternVL22025.01 | 61.5 | |
| InternVL3.5-1B# Total Params=1.1B2025.11 | 60.99 | |
| CacheBlendModel=Qwen3-VL-8B, Recomputation budget (k)=42026.03 | 58.56 | |
| LFM2-VL-1.6B# Total Params=1.6B2025.11 | 58.35 | |
| ICoT2026.02 | 58.1 | |
| No RecomputeModel=Qwen3-VL-8B, Recomputation budget (k)=42026.03 | 57.88 | |
| EPICModel=Qwen3-VL-8B, Recomputation budget (k)=42026.03 | 57.82 | |
| LLaDA-oModel Architecture Style=Diff. Based2026.03 | 54.7 | |
| RADIOv2.5-H + TilingVision Encoder=RADIOv2.5-H (ours) + Tiling, Resolution=Up to 7 × 768², Compression=ToMe r=2108, Tokens/im=~ 12332024.12 | 46.5 | |
| RADIOv2.5-HVision Encoder=RADIOv2.5-H, LLM=Qwen2-7B-Instruct, SFT Data Mixture=9.8M samples, Tokens per image=5122024.12 | 45.6 | |
| LaViDa-OModel Architecture Style=Diff. Based2026.03 | 44.6 | |
| LFM2-VL-450M# Total Params=0.45B2025.11 | 44.56 | |
| Emu3Model Architecture Style=AR Based2026.03 | 43.8 | |
| SigLIP-SO400MVision Encoder=SigLIP-SO400M, LLM=Qwen2-7B-Instruct, SFT Data Mixture=9.8M samples, Tokens per image=5122024.12 | 40.9 | |
| SigLIP SO400M + TilingVision Encoder=SigLIP SO400M [52] + Tiling, Resolution=Up to 13 × 384², Compression=2 × 2 Unshuffle, Tokens/im=~ 19282024.12 | 40.1 | |
| RADIOv2.5-HResolution=768², Tokens per image=512, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 37.6 | |
| RADIOv2.5-HResolution=768², Tokens per image=196, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 37 | |
| RADIOv2.5-HVision Encoder=RADIOv2.5-H (ours), Resolution=768², Compression=ToMe r=2108, Tokens/im=1962024.12 | 36.7 | |
| SigLIP-SO400MResolution=384², Tokens per image=196, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 36 | |
| LaViDa-LModel Architecture Style=Diff. Based2026.03 | 34.2 | |
| OpenAI-CLIPResolution=336², Tokens per image=144, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 33 | |
| RADIOv2.5-gResolution=672^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 30.9 | |
| RADIOv2.5-HResolution=768^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 30.8 | |
| AM-RADIO-HResolution=512², Tokens per image=256, LLM=Qwen2-7B-Instruct, Training Data=ShareGPT4v and VFLAN2024.12 | 30.6 | |
| RADIOv2.5-LResolution=768^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 29.8 | |
| SigLIP-SO400MResolution=384^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 29.2 | |
| OpenAI-CLIPResolution=336^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 27.4 | |
| RADIOv2.1-HResolution=512^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 26.2 | |
| LLaVA-1.5-13B + ViCropThroughput=0.39×, Maximum visual tokens=5762026.04 | 25.9 | |
| LLaVA-1.5-13B + Q-ZoomThroughput=0.66×, Maximum visual tokens=5762026.04 | 25.1 | |
| RADIOv2.1-HResolution=768^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 24.8 | |
| LLaVA-1.5-13B + SD-RPNThroughput=0.64×, Maximum visual tokens=5762026.04 | 24.8 | |
| LLaVA-1.5-13B + S2Throughput=0.71×, Maximum visual tokens=5762026.04 | 24.7 | |
| SmolVLM2-500M# Total Params=0.5B2025.11 | 24.64 | |
| LLaVA-1.5-13BThroughput=1.0×, Maximum visual tokens=5762026.04 | 23.4 | |
| LLaVA-1.5-7B + S2Throughput=0.70×, Maximum visual tokens=5762026.04 | 22.5 | |
| LLaVA-1.5-7B + Q-ZoomThroughput=0.64×, Maximum visual tokens=5762026.04 | 22.4 | |
| LLaVA-1.5-7B + SD-RPNThroughput=0.62×, Maximum visual tokens=5762026.04 | 22.3 | |
| LLaVA-1.5-7B + ViCropThroughput=0.42×, Maximum visual tokens=5762026.04 | 21.4 | |
| LLaVA-1.5-7BThroughput=1.0×, Maximum visual tokens=5762026.04 | 20.4 | |
| MMaDAModel Architecture Style=Diff. Based2026.03 | 14.9 | |
| Lumina-DiMOOModel Architecture Style=Diff. Based2026.03 | 6.2 |