General Multimodal Understanding on General Benchmarks
74Average ScoreJARVIS
Evaluation Results
| Method | Links | |
|---|---|---|
| JARVISLLM=Qwen2-7B, Visual Encoder=SigLIP2 ViT-L2025.12 | 74 | |
| LLaVALLM=Qwen2-7B, Visual Encoder=SigLIP2 ViT-L2025.12 | 72.4 | |
| LLaVALLM=Qwen2-7B, Visual Encoder=CLIP ViT-L2025.12 | 72 | |
| JARVISLLM=Qwen2-7B, Visual Encoder=CLIP ViT-L2025.12 | 71.9 | |
| LLaVALLM=LLaMA-3.2-3B, Visual Encoder=CLIP ViT-L2025.12 | 67.4 | |
| JARVISLLM=Ministral-8B, Visual Encoder=CLIP ViT-L2025.12 | 67.2 | |
| JARVISLLM=LLaMA-3.2-3B, Visual Encoder=CLIP ViT-L2025.12 | 67 | |
| LLaVALLM=Gemma2-2B, Visual Encoder=CLIP ViT-L2025.12 | 66.5 | |
| JARVISLLM=Gemma2-2B, Visual Encoder=CLIP ViT-L2025.12 | 66.1 | |
| LLaVALLM=Vicuna-7B, Visual Encoder=CLIP ViT-L2025.12 | 65.8 | |
| LLaVALLM=Ministral-8B, Visual Encoder=CLIP ViT-L2025.12 | 65.5 | |
| JARVISLLM=Vicuna-7B, Visual Encoder=CLIP ViT-L2025.12 | 65.1 |