Visual Question Answering on VQA v2
100AccuracyLLaVA-1.5-7B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LLaVA-1.5-7BTokens=5762026.05 | 100 | 77.7 | — | — | |
| ETCTokens=42026.05 | 95.33 | 74.1 | — | — | |
| ETCTokens=22026.05 | 94.55 | 72.68 | — | — | |
| ETCTokens=12026.05 | 92.22 | 72.31 | — | — | |
| DeepSeek-VLLLM=DeepSeek-7B, Encoder=SigLIP-L 384 / SAM-B 1024, Resolution=Unk, Zero-shot=true2024.04 | 88.1 | — | — | — | |
| PaliGemma2-3B + AuditDMResolution=448x448, Fine-tuning=per-task2025.12 | 86.7 | — | — | — | |
| PALI-X-55Bmode=specialist2023.08 | 86.1 | — | — | — | |
| Single Task SoTA2023.12 | 86 | — | — | — | |
| PALI-X-55BParams=55B, Model Type=Specialist2024.04 | 86 | — | — | — | |
| PALI-X-55BModel Category=task-specific fine-tuning models2023.12 | 86 | — | — | — | |
| PaliGemma2-10BResolution=448x448, Fine-tuning=per-task2025.12 | 85.8 | — | — | — | |
| PaliGemma2-28BResolution=448x448, Fine-tuning=per-task2025.12 | 85.8 | — | — | — | |
| LongVILA-7B (S3)LLM=Qwen2-7B, Resolution=dynamic2024.08 | 85.4 | — | — | — | |
| Emu2-Chattrained on task training set=true2023.12 | 84.9 | — | — | — | |
| Emu2-ChatLLM=LLAMA-33B, Res.=4482024.03 | 84.9 | — | — | — | |
| DSCA2026.04 | 84.9 | — | — | — | |
| PaliGemma2-3BResolution=448x448, Fine-tuning=per-task2025.12 | 84.8 | — | — | — | |
| CogVLMModel Category=task-specific fine-tuning models2023.12 | 84.7 | — | — | — | |
| IndividualBackbone=BEiT3-base2024.05 | 84.39 | — | — | — | |
| Method [50]2023.05 | 84.3 | — | — | — | |
| PaLI-17B#Params=17B, Model Type=Specialist, Evaluation Protocol=Fine-tuned2023.11 | 84.3 | — | — | — | |
| SOTA2024.06 | 84.3 | — | — | — | |
| CAPABackbone=Qwen2.5-VL-7B, Pruning Stage=Late, Token Retention Rate=25%2026.01 | 84.3 | — | — | — | |
| CAPABackbone=Qwen2.5-VL-7B, Pruning Stage=Transition, Token Retention Rate=25%2026.01 | 84.1 | — | — | — | |
| PaLI-X-VPDModel Scale=55B2023.12 | 83.9 | — | — | — | |
| VanillaBackbone=Qwen2.5-VL-7B, Pruning Stage=N/A, Token Retention Rate=100%2026.01 | 83.74 | — | — | — | |
| CogAgentLLM=Vicuna-7B, Params=18B, Model Type=Generalist2024.04 | 83.7 | — | — | — | |
| CogAgentModel Category=generalist models2023.12 | 83.7 | — | — | — | |
| PaLI-X-InstructModel Scale=55B2023.12 | 83.6 | — | — | — | |
| MoVALLM=Vicuna-7B, Params=10B, Model Type=Specialist2024.04 | 83.5 | — | — | — | |
| MoVALLM=Llama3-8B, Params=11B, Model Type=Specialist2024.04 | 83.5 | — | — | — | |
| DualEdit2026.04 | 83.5 | — | — | — | |
| CogVLMLLM=Vicuna-7B, In-house data=true2024.03 | 83.4 | — | — | — | |
| CogVLMtrained on task training set=true2023.12 | 83.4 | — | — | — | |
| CogVLMModel Category=generalist models2023.12 | 83.4 | — | — | — | |
| AuroraEdge-V-2BNumber of parameters=2B2026.01 | 83.21 | — | — | — | |
| LLaVA-NeXT + MoVE-KD-v1.0LLM=Vicuna-13B, Model Scale=13B2025.01 | 83.1 | — | — | — | |
| CAPABackbone=Qwen2.5-VL-7B, Pruning Stage=Early, Token Retention Rate=25%2026.01 | 83.1 | — | — | — | |
| DeepStack-L-HDLLM=Vicuna-13B, Eff. Res.=1344, Vis. Tok.=14400, Cxt. Len.=2880, PT=558K, SFT=748K2024.06 | 83 | — | — | — | |
| VILA-1.5Language Model Scale=7B, Training Data Scale=Standard2025.01 | 83 | — | — | — | |
| CoS-7BPT tks.=80, Parm.=532M, Training set observed=true2024.07 | 82.9 | — | — | — | |
| VILA2-8BLLM Parameters=8B, Vision Tower Parameters=400M, Tokens per image=196, Pre-training data size=51M2024.07 | 82.9 | — | — | — | |
| LLaVA-NextLLM=Vicuna-13B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=2880, PT=558K, SFT=765K2024.06 | 82.8 | — | — | — | |
| LLaVA-NeXTLLM=Vicuna-13B, #Data=1.3M, Max Res.=672x672, #Token=28802024.07 | 82.8 | — | — | — | |
| LLaVA-NeXTBackbone=Vicuna-13B, #Data=1.2M2024.06 | 82.8 | — | — | — | |
| MM1-7B-ChatLLM Parameters=7B, Vision Tower Parameters=300M, Tokens per image=720, Pre-training data size=>2B2024.07 | 82.8 | — | — | — | |
| LLaVA-NeXTLLM=Vicuna-13B, Model Scale=13B2025.01 | 82.8 | — | — | — | |
| FeatherBackbone=Qwen2.5-VL-7B, Pruning Stage=Late, Token Retention Rate=25%2026.01 | 82.8 | — | — | — | |
| FeatherBackbone=Qwen2.5-VL-7B, Pruning Stage=Transition, Token Retention Rate=25%2026.01 | 82.79 | — | — | — | |
| FastVBackbone=Qwen2.5-VL-7B, Pruning Stage=Transition, Token Retention Rate=25%2026.01 | 82.75 | — | — | — | |
| FastVBackbone=Qwen2.5-VL-7B, Pruning Stage=Late, Token Retention Rate=25%2026.01 | 82.75 | — | — | — | |
| FastVBackbone=Qwen2.5-VL-7B, Pruning Stage=Early, Token Retention Rate=25%2026.01 | 82.73 | — | — | — | |
| FeatherBackbone=Qwen2.5-VL-7B, Pruning Stage=Early, Token Retention Rate=25%2026.01 | 82.71 | — | — | — | |
| UniformBackbone=Qwen2.5-VL-7B, Pruning Stage=Late, Token Retention Rate=25%2026.01 | 82.62 | — | — | — | |
| UniformBackbone=Qwen2.5-VL-7B, Pruning Stage=Early, Token Retention Rate=25%2026.01 | 82.61 | — | — | — | |
| UniformBackbone=Qwen2.5-VL-7B, Pruning Stage=Transition, Token Retention Rate=25%2026.01 | 82.61 | — | — | — | |
| LLaVA-HR-XParam.=14B, Res.=1024, Data=1.2M, Inference Speed=12.9 t/s, Evaluation Protocol=In-domain2024.03 | 82.6 | — | — | — | |
| Meteor2024.05 | 82.5 | — | — | — | |
| InfMLLM-7B-ChatLLM=Vicuna-7B2023.11 | 82.3 | — | — | — | |
| LLaVA-HRParam.=13.4B, Res.=1024, Data=1.2M, Inference Speed=15.0 t/s, Evaluation Protocol=In-domain2024.03 | 82.3 | — | — | — | |
| CogVLM-17BPT tks.=256, Parm.=10B, Training set observed=true2024.07 | 82.3 | — | — | — | |
| CogVLM-13B-ChatBackbone=Vicuna-7B, #Data=>1.5B2024.06 | 82.3 | — | — | — | |
| LLaVA-HRParam.=13B, Speed=3.12024.10 | 82.3 | — | — | — | |
| MoVALLM=Hermes-Yi-34B, Params=38B, Model Type=Specialist2024.04 | 82.3 | — | — | — | |
| LLaVA-NeXT + MoVE-KD-v1.0LLM=Vicuna-7B, Model Scale=7B2025.01 | 82.3 | — | — | — | |
| LLaVA-NeXT-13BBackbone=LLaVA-NeXT-13B, Tokens Retained=2880, Pruning Ratio=0%2026.02 | 82.3 | — | — | — | |
| BLIP-2Model Category=task-specific fine-tuning models2023.12 | 82.2 | — | — | — | |
| LiveEdit2026.04 | 82.1 | — | — | — | |
| InfiMM-HDLLM=Vicuna-13B, In-house data=false2024.03 | 82 | — | — | — | |
| FlamingoModel Scale=80B2023.12 | 82 | — | — | — | |
| DeepStack-L-HDLLM=Vicuna-7B, Eff. Res.=1344, Vis. Tok.=14400, Cxt. Len.=2880, PT=558K, SFT=748K2024.06 | 82 | — | — | — | |
| LLaVA-TokenPacker-HDLLM=Vicuna-13B, #Data=2.7M, Max Res.=1088x1088, #Token=~9542024.07 | 82 | — | — | — | |
| γ-MoD-LLaVA-HRParam.=13B, Speed=4.82024.10 | 82 | — | — | — | |
| InfMLLM-7BLLM=Vicuna-7B2023.11 | 81.95 | — | — | — | |
| LLaVA-HRParam.=7.4B, Res.=1024, Data=1.2M, Inference Speed=19.7 t/s, Evaluation Protocol=In-domain2024.03 | 81.9 | — | — | — | |
| LLaVA-HRParam.=7B, Speed=4.72024.10 | 81.9 | — | — | — | |
| LLaVA-NextLLM=Vicuna-7B, Eff. Res.=672, Vis. Tok.=2880, Cxt. Len.=2880, PT=558K, SFT=765K2024.06 | 81.8 | — | — | — | |
| LLaVA-NeXTLLM=Vicuna-7B, #Data=1.3M, Max Res.=672x672, #Token=28802024.07 | 81.8 | — | — | — | |
| InternVL2-8B-FTRP fine-tuning=None2024.08 | 81.8 | — | — | — | |
| InternVL2-8B + RPRP fine-tuning=Object Replacement Data2024.08 | 81.8 | — | — | — | |
| LLaVA-NextSize=7.4B, Evaluation Protocol=Zero-shot2025.02 | 81.8 | — | — | — | |
| LLaVA-NeXTLLM=Vicuna-7B, Model Scale=7B2025.01 | 81.8 | — | — | — | |
| VanillaBackbone=LLaVA-NeXT-7B, Token Budget=2880 Tokens, Venue=-2026.02 | 81.8 | — | — | — | |
| SparseCutLLM=Vicuna-13B, Eff. Res.=672, Vis. Len.=2880, Con. Len.=576, PT=558K, SFT=665K2026.01 | 81.8 | — | — | — | |
| VanillaBackbone=LLaVA-Next-7B, Token Reduction Rate=0.0%2025.05 | 81.8 | — | — | — | |
| LLaVA-Next-7BToken Budget=2880 (100%), Venue=CVPR’242026.04 | 81.8 | — | — | — | |
| GIT2#Params=5.1B, Model Type=Specialist, Evaluation Protocol=Fine-tuned2023.11 | 81.7 | — | — | — | |
| LLaVA-UHD#Data=1.2M, MaxRes.=672x1008, AR.=Any, TFLOPS=14.62024.03 | 81.7 | — | — | — | |
| LLaVA-UHDLLM=Vicuna-13B, #Data=1.2M, Max Res.=672x10082024.07 | 81.7 | — | — | — | |
| LLaVA-TokenPacker-HDLLM=Vicuna-13B, #Data=2.7M, Max Res.=1344x1344, #Token=~1393, sampling_ratio_s=22024.07 | 81.7 | — | — | — | |
| LLaVA-TokenPacker-HDLLM=Vicuna-13B, #Data=2.7M, Max Res.=1344x1344, #Token=~619, sampling_ratio_s=32024.07 | 81.7 | — | — | — | |
| LLaVA-UHDBackbone=Vicuna-13B, #Data=1.2M2024.06 | 81.7 | — | — | — | |
| VanillaBackbone=InternVL-2.5-8B, Token Retention Rate=100%2025.12 | 81.7 | — | — | — | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=960, Pruning Ratio=66.7%2026.02 | 81.6 | — | — | — | |
| Bunny-4BLLM=Phi-3-3.8B, Visual Encoder=SigLIP-SO@384, #PT=2M, #FT=695K2024.05 | 81.5 | — | — | — | |
| Imp-4BLLM=Phi-3-3.8B, Visual Encoder=SigLIP-SO@384, #PT=558K, #FT=1M2024.05 | 81.5 | — | — | — | |
| Mini-Gemini-HDLLM=Vicuna-13B, #Data=2.7M, Max Res.=1536x1536, #Token=28802024.07 | 81.5 | — | — | — | |
| Magma-8B (Full)Number of Parameters=8B, Finetuning=true, Pre-training configuration=Full with SoM/ToM2025.02 | 81.4 | — | — | — | |
| Magma-8B (Actw/o)Number of Parameters=8B, Finetuning=true, Pre-training configuration=Action without SoM/ToM2025.02 | 81.3 | — | — | — | |
| Magma-8B (Fullw/o)Number of Parameters=8B, Finetuning=true, Pre-training configuration=Full without SoM/ToM2025.02 | 81.3 | — | — | — |