Science Question Answering on ScienceQA IMG
98.2AccuracyEMOVA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EMOVAModel Size=72B2024.09 | 98.2 | — | |
| EMOVAModel Size=7B2024.09 | 96.4 | — | |
| LLaVA-OneVision 7B, DenseBackbone=LLaVA-OneVision 7B, Sparsity=Dense2026.03 | 95.93 | — | |
| CoS-7BPT tks.=80, Parm.=532M, Training set observed=true2024.07 | 93.9 | — | |
| EMOVAModel Size=3B2024.09 | 92.7 | — | |
| CogVLM-17BPT tks.=256, Parm.=10B, Training set observed=true2024.07 | 91.2 | — | |
| InstructBLIPLLM Backbone=FlanT5-XXL, Evaluation Protocol=finetuning2023.05 | 90.7 | — | |
| BLIP-2LLM Backbone=FlanT5-XXL, Evaluation Protocol=finetuning2023.05 | 89.5 | — | |
| LLaVAEvaluation Protocol=finetuning2023.05 | 89 | — | |
| Qwen3-VL-2BRatio=100%2026.05 | 86.25 | — | |
| MoAIZero-shot=true, Number of Parameters=7B2024.03 | 83.5 | — | |
| CoLLaVONumber of Parameters=7B, Setting=Zero-shot2024.02 | 80.7 | — | |
| ATV-PruningBackbone=LLaVA-OneVision 7B, Sparsity=60% Sparsity2026.03 | 80.47 | — | |
| InstructBLIPLLM Backbone=Vicuna-7B, Evaluation Protocol=finetuning2023.05 | 79.5 | — | |
| SparseGPTBackbone=LLaVA-OneVision 7B, Sparsity=60% Sparsity2026.03 | 79.03 | — | |
| WandaBackbone=LLaVA-OneVision 7B, Sparsity=60% Sparsity2026.03 | 78.58 | — | |
| TAMPBackbone=LLaVA-OneVision 7B, Sparsity=60% Sparsity2026.03 | 78.58 | — | |
| Brote-IM-XXL#Param LLM=11B, Setting=Zero-shot, Input=Single-image2024.02 | 78.38 | — | |
| Imp-4BLLM=Phi-3-3.8B, Visual Encoder=SigLIP-SO@384, #PT=558K, #FT=1M2024.05 | 78.3 | — | |
| CuMoLLM=Mixtral-8×7B, Act.=13.5B2024.05 | 77.9 | — | |
| Brote-EX-XXL#Param LLM=11B, Setting=Zero-shot, Input=Single-image2024.02 | 77.69 | — | |
| BLIP-2LLM Backbone=Vicuna-7B, Evaluation Protocol=finetuning2023.05 | 77.3 | — | |
| GPT-4V2024.09 | 75.7 | — | |
| MM1LLM=MM1-7B-MoE2024.05 | 75.3 | — | |
| MMICL-XXL#Param LLM=11B, Setting=Zero-shot, Input=Single-image2024.02 | 74.92 | — | |
| SPHINX-MoELLM=Mixtral-8×7B2024.05 | 74.5 | — | |
| SPHINX-MoELLM Training #P=8x7B, Input image resolution (Res.)=448, Pre-training samples (PT)=-, Instruction tuning samples (IT)=15.3M2024.08 | 74.5 | — | |
| CDPrunerRatio=60%2026.05 | 74.4 | — | |
| DivPruneRatio=60%2026.05 | 74.29 | — | |
| SPHINX-PlusLLM=LLaMA2-13B2024.05 | 74.2 | — | |
| CuMoLLM=Mistral-7B, Act.=7.8B2024.05 | 73.9 | — | |
| DivPruneRatio=40%2026.05 | 73.88 | — | |
| VisionZipRatio=40%2026.05 | 73.83 | — | |
| MoExtendLLM Training #P=3B, Input image resolution (Res.)=336, Pre-training samples (PT)=558K, Instruction tuning samples (IT)=665K2024.08 | 73.8 | — | |
| VisionZipRatio=60%2026.05 | 73.73 | — | |
| VILALLM=Vicuna-13B, Act.=13.4B2024.05 | 73.7 | — | |
| VILA-13BLLM=Llama-2-13B, Resolution=336, Pre-training samples=50M, Instruction tuning samples=1M2023.12 | 73.7 | — | |
| VILA-13BPT tks.=576, Parm.=13B, Training set observed=false2024.07 | 73.7 | — | |
| LLaVA-NeXTLLM=Vicuna-13B, Act.=13.4B2024.05 | 73.6 | — | |
| F3ARatio=60%2026.05 | 73.52 | — | |
| CDPrunerRatio=40%2026.05 | 73.37 | — | |
| LLaVA-NeXT 8B, DenseBackbone=LLaVA-NeXT 8B, Sparsity Pattern=Dense, Sparsity Type=N/A2026.03 | 73.28 | — | |
| FP16model_version=LLaVA-Next, model_scale=13B2026.04 | 73.23 | 68.23 | |
| F3ARatio=40%2026.05 | 73.22 | — | |
| LLaVA-NeXT-13BBackbone=LLaVA-NeXT-13B, Tokens Retained=2880, Pruning Ratio=0%2026.02 | 73.2 | — | |
| F3ARatio=20%2026.05 | 73.11 | — | |
| VILA-13B + ShareGPT4VLLM=Llama-2-13B, Resolution=336, Pre-training samples=50M, Instruction tuning samples=1M2023.12 | 73.1 | — | |
| WSVDmodel_version=LLaVA-Next, model_scale=13B2026.04 | 73.08 | 67.1 | |
| LLaVA-LLaMA3LLM=LLaMA3-8B-IT, Act.=8.4B2024.05 | 72.9 | — | |
| LLaVA-NeXTLLM=Mistral-7B, Act.=7.6B2024.05 | 72.8 | — | |
| Imp-3BLLM=Phi-2-2.7B, Visual Encoder=SigLIP-SO@384, #PT=558K, #FT=1M2024.05 | 72.8 | — | |
| MM1LLM=MM1-7B2024.05 | 72.6 | — | |
| MMICL-XL#Param LLM=3B, Setting=Zero-shot, Input=Single-image2024.02 | 72.58 | — | |
| Brote-IM-XL#Param LLM=3B, Setting=Zero-shot, Input=Single-image2024.02 | 72.58 | — | |
| FastVRatio=40%2026.05 | 72.34 | — | |
| CaMML-13BLLM=Vicuna-13B, Data=558K++665K2024.01 | 72.3 | — | |
| DivPruneBackbone=LLaVA-NeXT-13B, Tokens Retained=320, Pruning Ratio=88.9%2026.02 | 72.3 | — | |
| FSRBackbone=LLaVA-NeXT-13B, Tokens Retained=960, Pruning Ratio=66.7%2026.02 | 72.2 | — | |
| DivPruneBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 72.2 | — | |
| WSVDmodel_version=LLaVA-v1.5, model_scale=13B2026.04 | 72.14 | 67.1 | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=960, Pruning Ratio=66.7%2026.02 | 72.1 | — | |
| CDPrunerRatio=20%2026.05 | 72.09 | — | |
| FastVRatio=60%2026.05 | 71.99 | — | |
| DivPruneRatio=20%2026.05 | 71.99 | — | |
| VisPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=960, Pruning Ratio=66.7%2026.02 | 71.9 | — | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 71.9 | — | |
| FP16model_version=LLaVA-v1.5, model_scale=13B2026.04 | 71.83 | 68.23 | |
| FastVBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 71.7 | — | |
| HoloVBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 71.7 | — | |
| FastVRatio=20%2026.05 | 71.63 | — | |
| LLaVA-1.5LLM=Vicuna-13B, Resolution=3362023.11 | 71.6 | — | |
| LLaVA-1.5Param.=13.2B, Res.=336, Data=1.2M, Evaluation Protocol=Zero-shot2024.03 | 71.6 | — | |
| LLaVA-v1.5LLM=Vicuna-13B, Act.=13.4B2024.05 | 71.6 | — | |
| LLaVA-1.5LLM=Vicuna-1.5-13B, Resolution=336, Pre-training samples=0.6M, Instruction tuning samples=0.7M2023.12 | 71.6 | — | |
| LLaVA-1.5LLM=Vicuna-13B, Image Size=336^2, Pretrain Sample Size=558K, Finetune Sample Size=665K2023.10 | 71.6 | — | |
| LLaVA1.5Number of Parameters=13B, Setting=Zero-shot2024.02 | 71.6 | — | |
| LLaVA-1.5-13BLLM=Vicuna-1.5-13B, Resolution=3362024.06 | 71.6 | — | |
| LLaVA-v1.5-13BLLM=Vicuna-13B, Resolution=3362024.05 | 71.6 | — | |
| LLaVA-1.5LLM=Vicuna-13B, Data=558K+665K2024.01 | 71.6 | — | |
| LLaVA1.5Zero-shot=true, Number of Parameters=13B2024.03 | 71.6 | — | |
| LLaVA-1.5-13BPT tks.=576, Parm.=13B, Training set observed=false2024.07 | 71.6 | — | |
| LLaVA-1.5LLM Training #P=13B, Input image resolution (Res.)=336, Pre-training samples (PT)=558K, Instruction tuning samples (IT)=665K2024.08 | 71.6 | — | |
| LLaVA-1.5-13BLLM=Vicuna-13B2024.10 | 71.6 | — | |
| FSRBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 71.6 | — | |
| LLaVA-1.5-13BLLM=Vicuna-1.5-13B, Visual Encoder=CLIP-L@336, #PT=558K, #FT=665K2024.05 | 71.2 | — | |
| LLaVA-1.5-13B + MMFuserLLM=Vicuna-13B2024.10 | 71.2 | — | |
| VILA-13B-AWQModel Scale=13B, Quantization=INT4-g1282023.06 | 71.2 | — | |
| VisionZipRatio=20%2026.05 | 71.16 | — | |
| Brote-EX-XL#Param LLM=3B, Setting=Zero-shot, Input=Single-image2024.02 | 71.15 | — | |
| VisPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 71.1 | — | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=320, Pruning Ratio=88.9%2026.02 | 71.1 | — | |
| LLaVA-1.5-HDLLM=Vicuna-13B, Image Size=448^2, Pretrain Sample Size=558K, Finetune Sample Size=665K2023.10 | 71 | — | |
| Bunny-3BLLM=Phi-2-2.7B, Visual Encoder=SigLIP-SO@384, #PT=2M, #FT=695K2024.05 | 70.9 | — | |
| Bunny-3BLM=Phi-2-2.7B, Res.=3842024.12 | 70.9 | — | |
| Mipha-3BLM=Phi-2-2.7B, Res.=3842024.12 | 70.9 | — | |
| LLaVA-Instruct-13BLLM=Vicuna-1.5-13B, Resolution=3362024.06 | 70.8 | — | |
| VisionZipBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 70.8 | — | |
| OlympusLM=Phi-2-2.7B, Res.=3842024.12 | 70.7 | — | |
| InstructBLIP-XXL#Param LLM=11B, Setting=Zero-shot, Input=Single-image2024.02 | 70.6 | — | |
| HoloVBackbone=LLaVA-NeXT-13B, Tokens Retained=320, Pruning Ratio=88.9%2026.02 | 70.6 | — |