Science Question Answering on ScienceQA (test)
98.3Average AccuracyPerceptio
Evaluation Results
| Method | Links | |||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| PerceptioParameters=8B2026.03 | 98.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PVC InternVL2 (Ours)Size=8B, #token /image tile=642024.12 | 97.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PerceptioParameters=4B2026.03 | 97.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2Size=8B, #token /image tile=2562024.12 | 97.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Sa2VAParameters=8B2026.03 | 96.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReProbe# Sample=32K, Input Features=Hidden States, Annotation Source=DeepSeek-anno, Decoding Method=Beam search2025.11 | 96.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReProbe# Sample=32K, Input Features=Attn+Logit, Annotation Source=Self-anno, Decoding Method=Beam search2025.11 | 96.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OVSize=7B, #token /image tile=7292024.12 | 96 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Sa2VAParameters=4B2026.03 | 95.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwiftMode=Standard Mode, Thinking (%)=0.0 ± 0.02025.06 | 95.02 | — | — | — | — | — | — | — | — | — | — | — | 8.04 | 9.13 | 8.12 | 7.17 | 7.71 | 8.88 | — | |
| PVC InternVL2 (Ours)Size=2B, #token /image tile=642024.12 | 94.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RefitMode=Standard Mode, Thinking (%)=0.0 ± 0.02025.06 | 94.53 | — | — | — | — | — | — | — | — | — | — | — | 8.04 | 9.08 | 8.11 | 7.2 | 7.69 | 8.87 | — | |
| Honeybee (M=576)Model Category=Generalist Models, Number of visual tokens (M)=5762023.12 | 94.39 | 95.2 | 96.29 | 91.18 | 94.48 | 93.75 | 93.17 | 95.04 | 93.21 | — | — | — | — | — | — | — | — | — | — | |
| InternVL2-2BModel Scale=1B, Zero-shot=true, Decoding Strategy=beam search2024.09 | 94.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2Size=2B, #token /image tile=2562024.12 | 94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MR-MKG (FLAN-UL2-19B)#T-Param=248M, Backbone=FLAN-UL2-19B2024.06 | 93.63 | 95.74 | 90.33 | 92 | 95.5 | 92.41 | 93.31 | 93.98 | 93.01 | — | — | — | — | — | — | — | — | — | — | |
| Honeybee (M=256)Model Category=Generalist Models, Number of visual tokens (M)=2562023.12 | 93.19 | 93.12 | 96.63 | 90.55 | 92.52 | 91.77 | 92.26 | 93.72 | 92.22 | — | — | — | — | — | — | — | — | — | — | |
| ReProbe# Sample=32K, Input Features=Hidden States, Annotation Source=Self-anno, Decoding Method=Beam search2025.11 | 92.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MR-MKG (FLAN-T5-11B)#T-Param=248M, Backbone=FLAN-T5-11B2024.06 | 92.78 | 94.93 | 90.1 | 90.55 | 94.53 | 92.12 | 92.2 | 93.83 | 90.9 | — | — | — | — | — | — | — | — | — | — | |
| CogVLMCategory=Specialist2023.12 | 92.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA+GPT-4Ensemble strategy=judge2023.04 | 92.53 | 91.56 | 96.74 | 91.09 | 90.62 | 88.99 | 93.52 | 92.73 | 92.16 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA+GPT-4 (judge)Model Category=Specialist Models, Evaluation Judge=GPT-42023.12 | 92.53 | 91.56 | 96.74 | 91.09 | 90.62 | 88.99 | 93.52 | 92.73 | 92.16 | — | — | — | — | — | — | — | — | — | — | |
| CaMML-13BBackbone=Vicuna-13B2024.01 | 92.03 | — | — | — | 93.84 | 89.94 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM1.5-30BModel Scale=30B, Zero-shot=true, Decoding Strategy=greedy2024.09 | 91.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-COT Large#T-Params=738M, LLM=false2023.05 | 91.68 | 95.91 | 82 | 90.82 | 95.26 | 88.8 | 92.89 | 92.44 | 90.31 | — | — | — | — | — | — | — | — | — | — | |
| MM-CoT_Large#Tuned Params=738M2023.04 | 91.68 | 95.91 | 82 | 90.82 | 95.26 | 88.8 | 92.89 | 92.44 | 90.31 | — | — | — | — | — | — | — | — | — | — | |
| MM-COTModel size=Large2023.04 | 91.68 | 95.91 | 82 | 90.82 | 95.26 | 88.8 | 92.89 | 92.44 | 90.31 | — | — | — | — | — | — | — | — | — | — | |
| MM-COTModel Category=Specialist Models2023.12 | 91.68 | 95.91 | 82 | 90.82 | 95.26 | 88.8 | 92.89 | 92.44 | 90.31 | — | — | — | — | — | — | — | — | — | — | |
| UnifiedQA Large (MM-CoT)#T-Param=738M, Prompting=MM-CoT2024.06 | 91.68 | 95.91 | 82 | 90.82 | 95.26 | 88.8 | 92.89 | 92.44 | 90.31 | — | — | — | — | — | — | — | — | — | — | |
| MMCoT LargeSize=Large2024.01 | 91.68 | — | — | — | 95.26 | 88.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CaMML-7BBackbone=Vicuna-7B2024.01 | 91.32 | — | — | — | 93.21 | 89.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-Math-7B-PRM800k# Sample=263K, Decoding Method=Beam search2025.11 | 91.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA+GPT-4Ensemble strategy=complement2023.04 | 90.97 | 90.36 | 95.5 | 88.55 | 89.05 | 87.8 | 91.08 | 92.22 | 88.73 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA#T-Params=13B, LLM=true2023.05 | 90.92 | 90.36 | 95.95 | 88 | 89.49 | 88 | 90.66 | 90.93 | 90.9 | — | — | — | — | — | — | — | — | — | — | |
| LLaVAModel size=13B2023.04 | 90.92 | 90.36 | 95.95 | 88 | 89.49 | 88 | 90.66 | 90.93 | 90.9 | — | — | — | — | — | — | — | — | — | — | |
| LLaVAModel Category=Specialist Models2023.12 | 90.92 | 90.36 | 95.95 | 88 | 89.49 | 88 | 90.66 | 90.93 | 90.9 | — | — | — | — | — | — | — | — | — | — | |
| LLaVALLM Size=13B, Evaluation Protocol=Fine-tuning2023.11 | 90.92 | 90.36 | 95.95 | 88 | 89.49 | 88 | 90.66 | 90.93 | 90.9 | — | — | — | — | — | — | — | — | — | — | |
| LLaVASize=13B2023.02 | 90.92 | 90.36 | 95.95 | 88 | 89.49 | 88 | 90.66 | 90.93 | 90.9 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA#T-Param=13B2024.06 | 90.92 | 90.36 | 95.95 | 88 | 89.49 | 88 | 90.66 | 90.93 | 90.9 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-13BBackbone=Vicuna-13B2024.01 | 90.9 | — | — | — | 89.49 | 88 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LaVIN-13B†#T-Params=5.4M, LLM=true, trained_epochs=402023.05 | 90.83 | 89.88 | 94.49 | 89.82 | 88.95 | 87.61 | 91.85 | 91.45 | 89.72 | — | — | — | — | — | — | — | — | — | — | |
| Phi-3-Vision-4BModel Scale=3B, Zero-shot=true, Decoding Strategy=greedy2024.09 | 90.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ReProbe# Sample=32K, Input Features=Attn+Logit, Annotation Source=DeepSeek-anno, Decoding Method=Beam search2025.11 | 90.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InstructBLIPCategory=Specialist2023.12 | 90.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oZero-shot=true, Decoding Strategy=greedy2024.09 | 90.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LaVIN-13B#T-Params=5.4M, LLM=true2023.05 | 90.5 | 90.32 | 94.38 | 87.73 | 89.44 | 87.65 | 90.31 | 91.19 | 89.26 | — | — | — | — | — | — | — | — | — | — | |
| Multimodal-CoT LargeSize=738M2023.02 | 90.45 | 91.03 | 93.7 | 86.64 | 90.13 | 88.25 | 89.48 | 91.12 | 89.26 | — | — | — | — | — | — | — | — | — | — | |
| STaR-GATEMode=Standard Mode, Thinking (%)=0.0 ± 0.02025.06 | 90.05 | — | — | — | — | — | — | — | — | — | — | — | 7.85 | 8.88 | 7.98 | 7.06 | 7.52 | 8.62 | — | |
| STaR-GATE-DMode=Standard Mode, Thinking (%)=0.0 ± 0.02025.06 | 90.05 | — | — | — | — | — | — | — | — | — | — | — | 6.9 | 8.39 | 7.13 | 6.2 | 6.03 | 7.42 | — | |
| LaVIN-13B#T-Param=5.4M, Backbone=LLaMA-13B2024.06 | 90.03 | 89.88 | 94.49 | 89.82 | 88.95 | 87.61 | 91.85 | 91.45 | 89.72 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-SQA-7BArchitecture=LLaVA-SQA-7B, Ratio=02025.03 | 89.91 | 89.39 | 96.06 | 85.64 | 88.71 | 87.65 | 88.5 | 90.93 | 87.8 | — | — | — | — | — | — | — | — | — | — | |
| MM1.5-3B-MoEModel Scale=3B, Architecture=MoE, Zero-shot=true, Decoding Strategy=greedy2024.09 | 89.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM1.5-7BModel Scale=7B, Zero-shot=true, Decoding Strategy=greedy2024.09 | 89.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B + Cont. Rewardreward_type=Continuous2025.11 | 89.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EfficientLLaVAArchitecture=LLaVA-SQA-7B, Ratio=0.32025.03 | 89.46 | 89.39 | 93.36 | 86.45 | 88.51 | 86.47 | 89.34 | 89.98 | 88.53 | — | — | — | — | — | — | — | — | — | — | |
| LaVIN-7B#T-Params=3.8M, LLM=true2023.05 | 89.41 | 89.25 | 94.94 | 85.24 | 88.51 | 87.46 | 88.08 | 90.16 | 88.07 | — | — | — | — | — | — | — | — | — | — | |
| LaVIN-7B#T-Param=3.8M, Backbone=LLaMA-7B2024.06 | 89.41 | 89.25 | 94.94 | 85.24 | 88.51 | 87.46 | 88.08 | 90.16 | 88.07 | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-7BBackbone=Vicuna-7B2024.01 | 89.28 | — | — | — | 90.96 | 87.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SparseGPTArchitecture=LLaVA-SQA-7B, Ratio=0.32025.03 | 88.99 | 88.28 | 95.16 | 85.45 | 87.39 | 86.71 | 88.01 | 89.54 | 88 | — | — | — | — | — | — | — | — | — | — | |
| Chat-UniViLLM Size=7B, Evaluation Protocol=Fine-tuning2023.11 | 88.78 | 88.5 | 93.03 | 85.91 | 88.51 | 85.97 | 88.15 | 88.88 | 88.6 | — | — | — | — | — | — | — | — | — | — | |
| EfficientLLaVAArchitecture=LLaVA-SQA-7B, Ratio=0.42025.03 | 88.73 | 89.17 | 91.34 | 85.37 | 88.27 | 85.57 | 88.57 | 89.39 | 87.54 | — | — | — | — | — | — | — | — | — | — | |
| Vision-Zeroexternal supervision=true2025.11 | 88.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MR-MKG (FLAN-T5-3B)#T-Param=77M, Backbone=FLAN-T5-3B2024.06 | 88.47 | 90.67 | 85.38 | 86.45 | 90.96 | 87.46 | 87.39 | 90.27 | 85.23 | — | — | — | — | — | — | — | — | — | — | |
| HumanLLM=false2023.05 | 88.4 | 90.23 | 84.97 | 87.48 | 89.6 | 87.5 | 88.1 | 91.59 | 82.42 | — | — | — | — | — | — | — | — | — | — | |
| Human2023.04 | 88.4 | 90.23 | 84.97 | 87.48 | 89.6 | 87.5 | 88.1 | 91.59 | 82.42 | — | — | — | — | — | — | — | — | — | — | |
| Human2023.04 | 88.4 | 90.23 | 84.97 | 87.48 | 89.6 | 87.5 | 88.1 | 91.59 | 82.42 | — | — | — | — | — | — | — | — | — | — | |
| Humantype=Human baseline2023.12 | 88.4 | 90.23 | 84.97 | 87.48 | 89.6 | 87.5 | 88.1 | 91.59 | 82.42 | — | — | — | — | — | — | — | — | — | — | |
| HumanEvaluation Protocol=Baseline2023.11 | 88.4 | 90.23 | 84.97 | 87.48 | 89.6 | 87.5 | 88.1 | 91.59 | 82.42 | — | — | — | — | — | — | — | — | — | — | |
| Human2023.02 | 88.4 | 90.23 | 84.97 | 87.48 | 89.6 | 87.5 | 88.1 | 91.59 | 82.42 | — | — | — | — | — | — | — | — | — | — | |
| Human2024.06 | 88.4 | 90.23 | 84.97 | 87.48 | 89.6 | 87.5 | 88.1 | 91.59 | 82.42 | — | — | — | — | — | — | — | — | — | — | |
| Human Average2024.01 | 88.4 | — | — | — | 89.6 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BLIP-3Model Scale=3B, Zero-shot=true, Decoding Strategy=greedy2024.09 | 88.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B (Baseline)2025.11 | 88.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SmoGVLMSize=13B, Method=FFT2026.04 | 88.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B + Discrete Rewardreward_type=Discrete2025.11 | 87.98 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM1.5-1B-MoEModel Scale=1B, Architecture=MoE, Zero-shot=true, Decoding Strategy=greedy2024.09 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVASize=13B, Method=FFT2026.04 | 87.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SmoGVLMSize=7B, Method=FFT2026.04 | 86.87 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Chameleon (GPT-4)#Tuned Params=0M, Few-shot=true, Base LLM=GPT-42023.04 | 86.54 | 89.83 | 74.13 | 89.82 | 88.27 | 77.64 | 92.13 | 88.03 | 83.72 | — | — | — | — | — | — | — | — | — | — | |
| Chameleon (GPT-4)2023.02 | 86.54 | 89.83 | 74.13 | 89.82 | 88.27 | 77.64 | 92.13 | 88.03 | 83.72 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-SciTuneLLM Size=7B, Evaluation Protocol=Fine-tuning2023.11 | 86.11 | 84.5 | 94.15 | 82.91 | 88.35 | 83.64 | 88.74 | 85.05 | 85.6 | — | — | — | — | — | — | — | — | — | — | |
| MM1.5-3BModel Scale=3B, Zero-shot=true, Decoding Strategy=greedy2024.09 | 85.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini-1.5-ProZero-shot=true, Decoding Strategy=greedy2024.09 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cambrian-34BModel Scale=30B, Zero-shot=true, Decoding Strategy=greedy2024.09 | 85.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Multimodal-CoT BaseSize=223M2023.02 | 85.31 | 84.06 | 92.35 | 82.18 | 82.75 | 82.75 | 84.74 | 85.79 | 84.44 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-Adapter#T-Params=1.8M, LLM=true2023.05 | 85.19 | 84.37 | 88.3 | 84.36 | 83.72 | 80.32 | 86.9 | 85.83 | 84.05 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-Adapter#Tuned Params=1.8M2023.04 | 85.19 | 84.37 | 88.3 | 84.36 | 85.72 | 80.32 | 86.9 | 85.83 | 84.05 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-Adapter2023.04 | 85.19 | 84.37 | 88.3 | 84.36 | 83.72 | 80.32 | 86.9 | 85.83 | 84.05 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-AdapterModel Category=Specialist Models2023.12 | 85.19 | 84.37 | 88.3 | 84.36 | 83.72 | 80.32 | 86.9 | 85.83 | 84.05 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-AdapterLLM Size=7B, Evaluation Protocol=Fine-tuning2023.11 | 85.19 | 84.37 | 88.3 | 84.36 | 83.72 | 80.32 | 86.9 | 85.83 | 84.05 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-AdapterSize=6B2023.02 | 85.19 | 84.37 | 88.3 | 84.36 | 83.72 | 80.32 | 86.9 | 85.83 | 84.05 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-Adapter#T-Param=1.8M2024.06 | 85.19 | 84.37 | 88.3 | 84.36 | 83.72 | 80.32 | 86.9 | 85.83 | 84.05 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-AdapterBackbone=LLaMA2024.01 | 85.19 | — | — | — | 83.72 | 80.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ETTCAggregation Method=ETTC2026.05 | 85.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM-COT Base#T-Params=223M, LLM=false2023.05 | 84.91 | 87.52 | 77.17 | 85.82 | 87.88 | 82.9 | 86.83 | 84.65 | 85.37 | — | — | — | — | — | — | — | — | — | — | |
| MM-CoT#Tuned Params=223M2023.04 | 84.91 | 87.52 | 77.17 | 85.82 | 87.88 | 82.9 | 86.83 | 84.65 | 85.37 | — | — | — | — | — | — | — | — | — | — | |
| MM-COTModel size=Base2023.04 | 84.91 | 87.52 | 77.17 | 85.82 | 87.88 | 82.9 | 86.83 | 84.65 | 85.37 | — | — | — | — | — | — | — | — | — | — | |
| UnifiedQA Base (MM-CoT)#T-Param=223M, Prompting=MM-CoT2024.06 | 84.91 | 87.52 | 77.17 | 85.82 | 87.88 | 82.9 | 86.83 | 84.65 | 85.37 | — | — | — | — | — | — | — | — | — | — | |
| MMCoT BaseSize=Base2024.01 | 84.91 | — | — | — | 87.88 | 82.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-72BModel Scale=72B2026.05 | 84.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |