Science Question Answering on SciQA-IMG
89SciQA-IMG AccuracyPhi 3.5 Vision
Evaluation Results
| Method | Links | |
|---|---|---|
| Phi 3.5 Vision2024.12 | 89 | |
| Florence-VL 8B# Vis tok.=5762024.12 | 85.9 | |
| Florence-VL 3B# Vis tok.=5762024.12 | 84.6 | |
| SEA-PRIMELLM=Vicuna-13B, Res.=3842024.08 | 80.9 | |
| Cambrian 8B# Vis tok.=5762024.12 | 80.4 | |
| Vila 8B2024.12 | 79.9 | |
| SEA-PRIMELLM=Llama3-8B, Res.=3842024.08 | 79 | |
| SEA-PRIMELLM=Phi3-3.8B, Res.=3842024.08 | 78.7 | |
| Mini-Gemini-HD 8B# Vis tok.=28802024.12 | 75.1 | |
| SEA-PRIMELLM=Vicuna-7B, Res.=3842024.08 | 73.9 | |
| SparseCutLLM=Vicuna-13B, Eff. Res.=672, Vis. Len.=2880, Con. Len.=576, PT=558K, SFT=665K2026.01 | 71.8 | |
| LLaVA-1.5*LLM=Vicuna-13B, Res.=3362024.08 | 71.6 | |
| LLaVALLM=Vicuna-13B, Eff. Res.=336, Vis. Len.=576, Con. Len.=576, PT=558K, SFT=665K2026.01 | 71.6 | |
| InstructBLIPzero-shot=true, backbone=FlanT5-XXL2023.05 | 70.6 | |
| LLaVA-1.5 + HALVABackbone=LLaVA-1.5-7B, Learning Objective=HALVA2025.06 | 70.5 | |
| InstructBLIPzero-shot=true, backbone=FlanT5-XL2023.05 | 70.4 | |
| LLaVA-1.5 + HA-DPOBackbone=LLaVA-1.5-7B, Learning Objective=HA-DPO2025.06 | 70.3 | |
| LLaVA-1.5 + TL-DPOBackbone=LLaVA-1.5-7B, Learning Objective=TL-DPO2025.06 | 70.3 | |
| AlignGPTLLM=Vicuna-13B, Res.=3362024.08 | 70.3 | |
| MobileVLM-V2-3BLLM=MLLAMA 2.7B, Res.=3362024.08 | 70 | |
| LLaMA-VIDLLM=Vicuna-13B, Res.=3362024.08 | 70 | |
| SparseCutLLM=Vicuna-7B, Eff. Res.=672, Vis. Len.=2880, Con. Len.=576, PT=558K, SFT=665K2026.01 | 70 | |
| Visual PromptLLM=Vicuna-7B, Res.=3362024.08 | 69.5 | |
| SEA-PRIMELLM=Gemma-2B, Res.=3842024.08 | 69.2 | |
| TinyLLaVALLM=Phi-2.7B, Res.=3842024.08 | 69.1 | |
| AlignGPTLLM=Vicuna-7B, Res.=3362024.08 | 68.5 | |
| LLaVA-PhiLLM=Phi-2.7B, Res.=3362024.08 | 68.4 | |
| ShareGPT4VLLM=Vicuna-7B, Res.=3362024.08 | 68.4 | |
| LLaMA-VIDLLM=Vicuna-7B, Res.=3362024.08 | 68.3 | |
| Qwen-VL-ChatLLM=Qwen-7B, Res.=4482024.08 | 68.2 | |
| LLaVA-1.5*LLM=Vicuna-7B, Res.=3362024.08 | 67.9 | |
| Vila 3B2024.12 | 67.9 | |
| LLaVA-1.5 + POVIDBackbone=LLaVA-1.5-7B, Learning Objective=POVID2025.06 | 67.5 | |
| DeepStack-LLLM=Vicuna-7B, Eff. Res.=672, Vis. Len.=2880, Con. Len.=576, PT=558K, SFT=665K2026.01 | 67.2 | |
| LLaVA-1.5 + RLHF-VBackbone=LLaVA-1.5-7B, Learning Objective=RLHF-V2025.06 | 67.1 | |
| Qwen-VLLLM=Qwen-7B, Res.=4482024.08 | 67.1 | |
| Qwen-VLLLM=Qwen-7B, Eff. Res.=448, Vis. Len.=256, Con. Len.=256, PT=1.4B, SFT=50M2026.01 | 67.1 | |
| LLaVA-1.5Backbone=LLaVA-1.5-7B2025.06 | 66.8 | |
| LLaVALLM=Vicuna-7B, Eff. Res.=336, Vis. Len.=576, Con. Len.=576, PT=558K, SFT=665K2026.01 | 66.8 | |
| LLaVA-1.5 + VLfeedbackBackbone=LLaVA-1.5-7B, Learning Objective=VLfeedback2025.06 | 66.2 | |
| LLaVA-1.5 + Human-PreferenceBackbone=LLaVA-1.5-7B, Learning Objective=Human-Preference2025.06 | 65.8 | |
| BLIP-2zero-shot=true, backbone=FlanT5-XXL2023.05 | 64.5 | |
| InstructBLIPLLM=Vicuna-13B, Res.=2242024.08 | 63.1 | |
| InstructBLIPzero-shot=true, backbone=Vicuna-13B2023.05 | 63.1 | |
| InstructBLIPLLM=Vicuna-13B, Eff. Res.=224, Vis. Len.=32, Con. Len.=32, PT=129M, SFT=1.2M2026.01 | 63.1 | |
| MobileVLM-3BLLM=MLLAMA 2.7B, Res.=3362024.08 | 61 | |
| BLIP-2zero-shot=true, backbone=Vicuna-13B2023.05 | 61 | |
| BLIP-2LLM=Vicuna-13B, Eff. Res.=224, Vis. Len.=32, Con. Len.=32, PT=129M, SFT=-2026.01 | 61 | |
| InstructBLIPzero-shot=true, backbone=Vicuna-7B2023.05 | 60.5 | |
| InstructBLIPLLM=Vicuna-7B, Eff. Res.=224, Vis. Len.=32, Con. Len.=32, PT=129M, SFT=1.2M2026.01 | 60.5 | |
| BLIP-2zero-shot=true, backbone=FlanT5-XL2023.05 | 54.9 | |
| BLIP-2zero-shot=true, backbone=Vicuna-7B2023.05 | 53.8 | |
| LLaVA next 8B# Vis tok.=28802024.12 | 40.1 |