Visual Question Answering on GQA (Accuracy)
74.9AccuracyConFoThinking (Qwen3-VL-8B)
Evaluation Results
| Method | Links | |
|---|---|---|
| ConFoThinking (Qwen3-VL-8B)Backbone=Qwen3-VL-8B2026.02 | 74.9 | |
| ConFoThinking (Qwen3-VL-4B)Backbone=Qwen3-VL-4B2026.02 | 74.2 | |
| Qwen3-VL-8B (with tools)Backbone=Qwen3-VL-8B, Thinking Tools=true2026.02 | 71.9 | |
| Contrastive AttentionBase Model=LLaVA-v1.62026.01 | 71.6 | |
| Qwen3-VL-8BBackbone=Qwen3-VL-8B2026.02 | 71.3 | |
| Qwen3-VL-4B (with tools)Backbone=Qwen3-VL-4B, Thinking Tools=true2026.02 | 70.2 | |
| Contrastive AttentionBase Model=LLaVA-v1.52026.01 | 69.4 | |
| LLaVA-v1.62026.01 | 69.3 | |
| Qwen3-VL-4BBackbone=Qwen3-VL-4B2026.02 | 69.3 | |
| LLaVA-FA-7BLLM=InternLM-2-20B, #Sample=5M, #Param=≥7B2026.01 | 68.5 | |
| InternVL3.5-8BBackbone=InternVL3.5-8B2026.02 | 68.2 | |
| LLaVA-OneVision-1.5-8BBackbone=LLaVA-OneVision-1.5-8B2026.02 | 67.7 | |
| GoM (Object Text IDs + Relation labels)MLM=LlamaV-o1-11B2026.03 | 67 | |
| ConFoThinking (Qwen2.5-VL-7B)Backbone=Qwen2.5-VL-7B2026.02 | 66.7 | |
| InternVL-ChatLLM=Vicuna-13B2025.12 | 66.6 | |
| S-MFTLanguage Model Backbone=Qwen2.5-14B, Vision Encoder=SigLIP-ViT-Large2025.12 | 66.5 | |
| LLaVA-v1.52026.01 | 66 | |
| FFTLanguage Model Backbone=Qwen2.5-14B, Vision Encoder=SigLIP-ViT-Large2025.12 | 65.6 | |
| LLaVA-NEXT-13BBase Model=LLaVA-NEXT-13B, Optimization Method=None2026.02 | 65.43 | |
| LLaVA-NeXTLLM=Vicuna-1.5-13B, #Sample=1.3M, #Param=≥7B2026.01 | 65.4 | |
| LLaVA-NextParams (#trainable)=13B, Text Backbone=AR, Image Backbone=-2024.12 | 65.4 | |
| LLaVA-NEXT-13B + Visual Lazy AttentionBase Model=LLaVA-NEXT-13B, Optimization Method=Visual Lazy Attention2026.02 | 65.33 | |
| LoRALanguage Model Backbone=Qwen2.5-14B, Vision Encoder=SigLIP-ViT-Large2025.12 | 65.3 | |
| LLaVA-Next-LLaMA-3-8BKV Size=7842026.05 | 65.3 | |
| LLaVA-FA-3BLLM=LLaMA-3-8B, #Sample=5M, #Param=∼3B2026.01 | 65 | |
| mPLUG-Owl3 8B# train tokens=0.1T, Architecture Category=Cross-attention-based – Public data, LLM Size=8B2025.12 | 65 | |
| GoM (Object Num IDs + Relation labels)MLM=Qwen-2.5-VL-7B2026.03 | 65 | |
| GoM (Object Num IDs + Relation labels)MLM=LlamaV-o1-11B2026.03 | 65 | |
| CogVLMLLM=Vicuna-7B, #Sample=1500M, #Param=≥7B2026.01 | 64.9 | |
| InternVL1.5 (SFT)Method Category=End-to-end, Evaluation Protocol=Supervised2025.12 | 64.6 | |
| LLaVA-NeXT2026.03 | 64.5 | |
| LLaVA-NEXT-7BBase Model=LLaVA-NEXT-7B, Optimization Method=None2026.02 | 64.24 | |
| VanillaBackbone=LLaVA-NeXT-7B, Token Budget=2880 Tokens, Venue=-2026.02 | 64.2 | |
| VanillaBackbone=LLaVA-NeXT-7B, Token Retention=2880, Reduction Ratio=100%2026.02 | 64.2 | |
| LLaVA-NEXT-7B + Visual Lazy AttentionBase Model=LLaVA-NEXT-7B, Optimization Method=Visual Lazy Attention2026.02 | 64.12 | |
| Cambrian-8B-CLIP-LKV Size=5762026.05 | 64 | |
| GoM (Object Text IDs + Relation labels)MLM=Qwen-2.5-VL-7B2026.03 | 63.8 | |
| LLaVA-NeXT2026.01 | 63.786 | |
| Qwen2-VL2026.01 | 63.7 | |
| Cambrian-8B-DINOv2-LKV Size=5762026.05 | 63.7 | |
| LLaVA-Next-Qwen2-7BKV Size=7842026.05 | 63.6 | |
| Imp-3BLLM=Phi-2-2.7B, #Sample=1.6M, #Param=∼3B2026.01 | 63.5 | |
| Pixel-Reasoner2026.02 | 63.4 | |
| LLaVA-v1.5-13B + Visual Lazy AttentionBase Model=LLaVA-v1.5-13B, Optimization Method=Visual Lazy Attention2026.02 | 63.31 | |
| LLaVA-1.5-13BReduction Ratio=0, # Vis. tokens=5762026.02 | 63.3 | |
| Alignedα=1, Model Architecture=LLAVA-V1.5-13B2025.06 | 63.3 | |
| LLaVA-v1.5-13BBase Model=LLaVA-v1.5-13B, Optimization Method=None2026.02 | 63.28 | |
| InternVL1.5Method Category=End-to-end, Evaluation Protocol=Zero-shot2025.12 | 63.2 | |
| Visual Sketchpad2026.02 | 63.2 | |
| GoM (Object Text IDs + Relation labels)MLM=Gemma-3-4B2026.03 | 63.2 | |
| PTPModel=InternVL2-8B, Pruning Method=PTP, Pruning Ratio (r)=0.5, Balancing Weight (alpha)=0.52025.09 | 63.1 | |
| ApETBackbone=LLaVA-NeXT-7B, Token Retention=640, Reduction Ratio=77.8%2026.02 | 63 | |
| LLaVA-v1.5-13B + Global Lazy AttentionBase Model=LLaVA-v1.5-13B, Optimization Method=Global Lazy Attention2026.02 | 62.98 | |
| InternVL-MLP2026.01 | 62.9 | |
| LLaVA-1.5Inference Mode=Normal, Pruning Rate (p)=0%, Mode Isolator Employment=No2026.02 | 62.82 | |
| Delta-CoMeα=1/16, Model Architecture=LLAVA-V1.5-13B2025.06 | 62.8 | |
| VideoLLaMA3Architecture Category=Token Insertion – Proprietary2025.12 | 62.7 | |
| PRINMIXα=1/16, Model Architecture=LLAVA-V1.5-13B2025.06 | 62.7 | |
| InternVL2-8BModel=InternVL2-8B, Pruning Method=None2025.09 | 62.7 | |
| PaliGemma2026.01 | 62.57 | |
| Upper boundBackbone=Janus-Pro-1B2025.12 | 62.55 | |
| Bunny-3BLLM=Phi-2-2.7B, #Sample=2.7M, #Param=∼3B2026.01 | 62.5 | |
| GoM (Object Text IDs)MLM=Qwen-2.5-VL-7B2026.03 | 62.5 | |
| GoM (Object Num IDs)MLM=LlamaV-o1-11B2026.03 | 62.5 | |
| LLaVA-NeXT-7B#Vision Tokens=28802026.03 | 62.5 | |
| FMVR-LLaVA#Vision Tokens=7202026.03 | 62.5 | |
| StreamChat 7BArchitecture Category=Cross-attention-based – Public data, LLM Size=7B2025.12 | 62.4 | |
| DUET-VLM (C)Visual Token Budget=Avg 192 Tokens2026.02 | 62.4 | |
| GoM (Object Text IDs)MLM=LlamaV-o1-11B2026.03 | 62.4 | |
| VILA-7BLLM=LLaMA-7B, #Sample=50M, #Param=≥7B2026.01 | 62.3 | |
| LLaVA-OV-7BKV Size=1962026.05 | 62.3 | |
| Visual FunnelModel=Qwen2.5-VL-3B-Instruct, Evaluation protocol=zero-shot2025.12 | 62.2 | |
| S-MFTLanguage Model Backbone=LLaMA2-13B, Vision Encoder=CLIP-ViT-Large2025.12 | 62.2 | |
| LLaVA-OneVision2026.01 | 62.14 | |
| LLaVA-FA-2BLLM=Qwen-2.5-7B, #Sample=5M, #Param=∼2B2026.01 | 62.1 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.02 | 62.1 | |
| ZoomEye2026.02 | 62.1 | |
| FMVR-LLaVA#Vision Tokens=28802026.03 | 62.1 | |
| DualSpeedInference Mode=Normal, Pruning Rate (p)=0%, Mode Isolator Employment=No2026.02 | 62.04 | |
| MoDEBackbone=Janus-Pro-1B, Training Stage=Best Accuracy2025.12 | 62.01 | |
| LLaVA-1.5-7BLLM=Vicuna-1.5-7B, #Sample=1.2M, #Param=≥7B2026.01 | 62 | |
| LLaVA-1.5LLM=Vicuna-7B2025.12 | 62 | |
| LLaVA-1.5LLM=Vicuna-7B2025.12 | 62 | |
| Upper Bound2025.12 | 62 | |
| SoMMLM=LlamaV-o1-11B2026.03 | 62 | |
| LLaVA-v1.5-7B + Global Lazy AttentionBase Model=LLaVA-v1.5-7B, Optimization Method=Global Lazy Attention2026.02 | 61.96 | |
| LLaVA-v1.5-7BBase Model=LLaVA-v1.5-7B, Optimization Method=None2026.02 | 61.94 | |
| LLaVA-v1.5-7B + Visual Lazy AttentionBase Model=LLaVA-v1.5-7B, Optimization Method=Visual Lazy Attention2026.02 | 61.93 | |
| LLaVA-1.5-7BToken Retention Rate=576, Base Model=LLaVA-1.5-7B2025.06 | 61.92 | |
| LLaVA-1.5-7BSparsity Op.=false, Sparsity Tok.=false, Vision-side Token=576, Vision-side TFLOPs (Rel.)=7.65 (100.0%)2026.02 | 61.9 | |
| Imp-2BLLM=Qwen-1.5-1.8B, #Sample=1.6M, #Param=∼2B2026.01 | 61.9 | |
| Vanilla (LLaVA-1.5-7B)Retained Tokens=5762026.01 | 61.9 | |
| LoRALanguage Model Backbone=LLaMA2-13B, Vision Encoder=CLIP-ViT-Large2025.12 | 61.9 | |
| S-MFT BothBackbone=Phi-2-2.7B, Epoch=0.64, Time (h)=8.122025.12 | 61.9 | |
| VanillaBase Model=LLaVA-1.5-7B, Retained Tokens=576, Reduction Rate=0%2026.02 | 61.9 | |
| LLaVA-1.5-7BVisual Token Budget=Total 576 Tokens2026.02 | 61.9 | |
| DUET-VLM (C)Visual Token Budget=Avg 128 Tokens2026.02 | 61.9 | |
| X-Omni2026.03 | 61.9 | |
| GoM (Object Num IDs)MLM=Qwen-2.5-VL-7B2026.03 | 61.9 | |
| Segmented objectsMLM=LlamaV-o1-11B2026.03 | 61.9 |