Visual Question Answering on SciQA IMG
87.1AccuracyASMv2
Evaluation Results
| Method | Links | |
|---|---|---|
| ASMv2Model Scale=13B, Seen Training Images=true2024.02 | 87.1 | |
| InfiMM-HDLLM=Vicuna-13B, In-house data=false2024.03 | 83.6 | |
| GroundingGPTLLM Size=7B2024.01 | 78.7 | |
| VILAModel Scale=13B2024.02 | 73.7 | |
| LLaVA-Next 13BLLM=Vicuna-13B, Encoder=CLIP VIT-large/14, Resolution=672, Zero-shot=true2024.04 | 73.57 | |
| FP16Model=LLaVA-Next 13B2026.05 | 73.23 | |
| WSVDModel=LLaVA-Next 13B, Quantization=W8A8, rho_1=50%2026.05 | 73.08 | |
| LLaVA-v1.5 13BLLM=Vicuna-13B, Encoder=CLIP VIT-large/14, Resolution=336, Zero-shot=true2024.04 | 72.88 | |
| LASERModel=LLaVA-Next 13B, Quantization=W8A8, rho_1=50%2026.05 | 72.11 | |
| LLaVA 1.5LLM=Vicuna-13B, In-house data=false2024.03 | 71.6 | |
| LLaVA-1.5Model Scale=13B2024.02 | 71.6 | |
| OmniFusionLLM=GigaChat-7B, Encoder=InternViT-6B-448px V1-2, Resolution=448, Zero-shot=true2024.04 | 71.29 | |
| HyperLLaVA w/o ELLLM=Vicuna-7B, Res.=336, PT=558K, IT=665K2024.03 | 70.7 | |
| Sphinx-2KLLM=LLAMA2-13B, In-house data=false2024.03 | 70.6 | |
| LLaVA-v1.5 7BLLM=Vicuna-7B, Encoder=CLIP VIT-large/14, Resolution=336, Zero-shot=true2024.04 | 70.43 | |
| QSVDModel=LLaVA-Next 13B, Quantization=W8A42026.05 | 70.43 | |
| HyperLLaVA w/o EvLLM=Vicuna-7B, Res.=336, PT=558K, IT=665K2024.03 | 70.4 | |
| HyperLLaVALLM=Vicuna-7B, Res.=336, PT=558K, IT=665K2024.03 | 70.4 | |
| DuQuantModel=LLaVA-Next 13B, Quantization=W8A42026.05 | 70.2 | |
| LLaVA-Next 7BLLM=Vicuna-7B, Encoder=CLIP VIT-large/14, Resolution=672, Zero-shot=true2024.04 | 70.15 | |
| OmniFusionLLM=Vicuna-7B, Encoder=CLIP VIT-large/14 + DinoV2, Resolution=336, Zero-shot=true2024.04 | 69.96 | |
| FP16Model=LLaVA-Next 7B2026.05 | 69.6 | |
| LLaVA-1.5-7BRetain Tokens=576, Pruning Ratio=0%2026.07 | 69.6 | |
| PDropRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 69.5 | |
| CDPrunerRetain Tokens=32, Pruning Ratio=94.4%2026.07 | 69.5 | |
| MonkeyLLM=Qwen-7B, In-house data=true2024.03 | 69.4 | |
| SparseVLMRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 69.3 | |
| EADPRetain Tokens=32, Pruning Ratio=94.4%2026.07 | 69.3 | |
| PruMerge+Retain Tokens=64, Pruning Ratio=88.9%2026.07 | 69.2 | |
| OmniFusionLLM=GigaChat-7B, Encoder=CLIP VIT-large/14 + grid-split, Resolution=672, Zero-shot=true2024.04 | 69.16 | |
| DARTRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 69.1 | |
| TRIMRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 69.1 | |
| DARTRetain Tokens=32, Pruning Ratio=94.4%2026.07 | 69.1 | |
| CDPrunerRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 69 | |
| EADPRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 69 | |
| SparseVLMRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 69 | |
| VisionZipRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 69 | |
| VisionZipRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 68.9 | |
| HiPruneRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 68.9 | |
| EADPRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 68.9 | |
| mPLUG-Owl2#Params=8.2B, Model Type=Generalist, Evaluation Protocol=Zero-shot2023.11 | 68.7 | |
| mPLUG-Owl2LLM=LLaMA2-7B, In-house data=false2024.03 | 68.7 | |
| FastVRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 68.7 | |
| FastVRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 68.7 | |
| DARTRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 68.7 | |
| VisionZipRetain Tokens=32, Pruning Ratio=94.4%2026.07 | 68.7 | |
| PruMerge+Retain Tokens=128, Pruning Ratio=77.8%2026.07 | 68.6 | |
| DivPruneRetain Tokens=32, Pruning Ratio=94.4%2026.07 | 68.6 | |
| LASERModel=LLaVA-Next 7B, Quantization=W8A8, rho_1=50%2026.05 | 68.37 | |
| TRIMRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 68.3 | |
| HiPruneRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 68.3 | |
| PDropRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 68.3 | |
| Qwen-VL-Chat#Params=9.6B, Model Type=Generalist, Evaluation Protocol=Zero-shot2023.11 | 68.2 | |
| Qwen-VL-Chat#Params=9.6B, Evaluation Mode=Zero-shot2023.12 | 68.2 | |
| Qwen-VL-ChatLLM=Qwen-7B, In-house data=true2024.03 | 68.2 | |
| Qwen-VL-ChatLLM=Qwen-7B, Res.=448, PT=1.4B, IT=50M2024.03 | 68.2 | |
| Qwen-VL-ChatLLM=Qwen-7B, Encoder=CLIP VIT-bigG/14, Resolution=448, Zero-shot=true2024.04 | 68.2 | |
| Qwen-VL-Chat2024.02 | 68.2 | |
| DivPruneRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 68.2 | |
| OmniFusionLLM=GigaChat-7B, Encoder=CLIP VIT-large/14, Resolution=336, Zero-shot=true2024.04 | 68.17 | |
| FP16Model=LLaVA-v1.5 7B2026.05 | 68.1 | |
| CDPrunerRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 68.1 | |
| PruMerge+Retain Tokens=32, Pruning Ratio=94.4%2026.07 | 68.1 | |
| DivPruneRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 68 | |
| TRIMRetain Tokens=32, Pruning Ratio=94.4%2026.07 | 68 | |
| OmniFusionLLM=Mistral-7B, Encoder=CLIP VIT-large/14 + DinoV2, Resolution=336, Zero-shot=true2024.04 | 67.55 | |
| LLaVA1.5-HACL#Params=7.2B, Evaluation Mode=Zero-shot2023.12 | 67.3 | |
| OmniFusionLLM=GigaChat-7B, Encoder=CLIP VIT-large/14 + DinoV2, Resolution=336, Zero-shot=true2024.04 | 67.18 | |
| Qwen-VLLLM=Qwen-7B, In-house data=true2024.03 | 67.1 | |
| Qwen-VLLLM=Qwen-7B, Res.=448, PT=1.4B, IT=50M2024.03 | 67.1 | |
| Qwen-VL2024.02 | 67.1 | |
| WSVDModel=LLaVA-Next 7B, Quantization=W8A8, rho_1=50%2026.05 | 66.94 | |
| LLaVA1.5#Params=7.2B, Evaluation Mode=Zero-shot2023.12 | 66.8 | |
| LLaVA-1.5LLM=Vicuna-7B, Res.=336, PT=558K, IT=665K2024.03 | 66.8 | |
| LLaVA-1.5LLM Size=7B2024.01 | 66.8 | |
| DuQuantModel=LLaVA-Next 7B, Quantization=W8A42026.05 | 66.34 | |
| LASERModel=LLaVA-v1.5 7B, Quantization=W8A8, rho_1=50%2026.05 | 66.14 | |
| QSVDModel=LLaVA-Next 7B, Quantization=W8A42026.05 | 66.1 | |
| QSVDModel=LLaVA-v1.5 7B, Quantization=W8A42026.05 | 65.61 | |
| QVLMModel=LLaVA-Next 13B, Quantization=W8A42026.05 | 65.28 | |
| WSVDModel=LLaVA-v1.5 7B, Quantization=W8A8, rho_1=50%2026.05 | 64.25 | |
| InstructBLIPLLM=Vicuna-13B, Res.=224, PT=129M, IT=1.2M2024.03 | 63.1 | |
| InstructBLIPModel Scale=13B2024.02 | 63.1 | |
| InstructBLIPLLM Size=13B2024.01 | 63.1 | |
| LLaVA-HACL#Params=7.2B, Evaluation Mode=Zero-shot2023.12 | 62.4 | |
| LLaVA-1.5#Params=7.2B, Model Type=Generalist, Evaluation Protocol=Zero-shot, OCR inputs=true2023.11 | 61.5 | |
| LLaVA#Params=7.2B, Evaluation Mode=Zero-shot2023.12 | 61.5 | |
| BLIP-2#Params=8.2B, Model Type=Generalist, Evaluation Protocol=Zero-shot2023.11 | 61 | |
| BLIP-2#Params=8.2B, Evaluation Mode=Zero-shot2023.12 | 61 | |
| BLIP-2LLM=Vicuna-13B, Res.=224, PT=129M, IT=-2024.03 | 61 | |
| BLIP-22024.02 | 61 | |
| BLIP-2LLM Size=13B2024.01 | 61 | |
| QVLMModel=LLaVA-Next 7B, Quantization=W8A42026.05 | 60.6 | |
| InstructBLIP#Params=8.2B, Model Type=Generalist, Evaluation Protocol=Zero-shot2023.11 | 60.5 | |
| InstructBLIP#Params=8.2B, Evaluation Mode=Zero-shot2023.12 | 60.5 | |
| InstructBLIPLLM=Vicuna-7B, Res.=224, PT=129M, IT=1.2M2024.03 | 60.5 | |
| InstructBLIPLLM Size=7B2024.01 | 60.5 | |
| MiniGPT-4-HACL#Params=7.2B, Evaluation Mode=Zero-shot2023.12 | 60.3 | |
| MiniGPT-4#Params=7.2B, Evaluation Mode=Zero-shot2023.12 | 58.4 | |
| DuQuantModel=LLaVA-v1.5 7B, Quantization=W8A42026.05 | 57.36 |