Visual Question Answering on ScienceQA full
75.85AccuracyLLaVA-Next 13B
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-Next 13BLLM=Vicuna-13B, Encoder=CLIP VIT-large/14, Resolution=672, Zero-shot=true2024.04 | 75.85 | |
| LLaVA-v1.5 13BLLM=Vicuna-13B, Encoder=CLIP VIT-large/14, Resolution=336, Zero-shot=true2024.04 | 74.96 | |
| OmniFusionLLM=GigaChat-7B, Encoder=InternViT-6B-448px V1-2, Resolution=448, Zero-shot=true2024.04 | 74.13 | |
| LLaVA-Next 7BLLM=Vicuna-7B, Encoder=CLIP VIT-large/14, Resolution=672, Zero-shot=true2024.04 | 73.21 | |
| OmniFusionLLM=GigaChat-7B, Encoder=CLIP VIT-large/14 + grid-split, Resolution=672, Zero-shot=true2024.04 | 73.21 | |
| OmniFusionLLM=Vicuna-7B, Encoder=CLIP VIT-large/14 + DinoV2, Resolution=336, Zero-shot=true2024.04 | 71.26 | |
| OmniFusionLLM=GigaChat-7B, Encoder=CLIP VIT-large/14, Resolution=336, Zero-shot=true2024.04 | 71.21 | |
| OmniFusionLLM=GigaChat-7B, Encoder=CLIP VIT-large/14 + DinoV2, Resolution=336, Zero-shot=true2024.04 | 71.09 | |
| LLaVA-v1.5 7BLLM=Vicuna-7B, Encoder=CLIP VIT-large/14, Resolution=336, Zero-shot=true2024.04 | 70.41 | |
| OmniFusionLLM=Mistral-7B, Encoder=CLIP VIT-large/14 + DinoV2, Resolution=336, Zero-shot=true2024.04 | 70.3 |