Knowledge-based Visual Question Answering on Knowledge Benchmarks
48.2Average ScoreJARVIS
Evaluation Results
| Method | Links | |
|---|---|---|
| JARVISLLM=Qwen2-7B, Visual Encoder=SigLIP2 ViT-L2025.12 | 48.2 | |
| JARVISLLM=Qwen2-7B, Visual Encoder=CLIP ViT-L2025.12 | 47.7 | |
| LLaVALLM=Qwen2-7B, Visual Encoder=SigLIP2 ViT-L2025.12 | 47.4 | |
| LLaVALLM=Qwen2-7B, Visual Encoder=CLIP ViT-L2025.12 | 46.7 | |
| LLaVALLM=LLaMA-3.2-3B, Visual Encoder=CLIP ViT-L2025.12 | 44.7 | |
| JARVISLLM=LLaMA-3.2-3B, Visual Encoder=CLIP ViT-L2025.12 | 44.3 | |
| LLaVALLM=Ministral-8B, Visual Encoder=CLIP ViT-L2025.12 | 42.2 | |
| JARVISLLM=Ministral-8B, Visual Encoder=CLIP ViT-L2025.12 | 42.2 | |
| LLaVALLM=Gemma2-2B, Visual Encoder=CLIP ViT-L2025.12 | 42 | |
| JARVISLLM=Gemma2-2B, Visual Encoder=CLIP ViT-L2025.12 | 41.9 | |
| JARVISLLM=Vicuna-7B, Visual Encoder=CLIP ViT-L2025.12 | 41.6 | |
| LLaVALLM=Vicuna-7B, Visual Encoder=CLIP ViT-L2025.12 | 41.4 |