Multimodal Evaluation on MMBench EN (test)
82.2AccuracyInternVL 1.2
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL 1.2#param=40B, open-source=false2024.04 | 82.2 | |
| InternVL 1.5#param=26B, open-source=false2024.04 | 82.2 | |
| LLaVA-NeXT#param=35B, open-source=false2024.04 | 81.1 | |
| Step-1V#param=100B, open-source=false2024.04 | 80.7 | |
| Mini-Gemini#param=35B, open-source=false2024.04 | 80.6 | |
| Qwen-VL-Maxopen-source=false2024.04 | 77.6 | |
| HPT Proopen-source=false2024.04 | 77.5 | |
| GPT-4Vopen-source=false2024.04 | 77 | |
| MM1#param=30B, open-source=false2024.04 | 75.1 | |
| Gemini Pro 1.0open-source=false2024.04 | 73.6 | |
| Claude-3 Sonnetopen-source=false2024.04 | 67.8 | |
| Qwen-VL-Plusopen-source=false2024.04 | 67 | |
| LLaVA-1.5 + Meta CLIP 2Vision Encoder=Meta CLIP 2, LMM Base Architecture=LLaVA-1.52025.10 | 67 | |
| LLaVA-1.5 + CLIPVision Encoder=CLIP, LMM Base Architecture=LLaVA-1.52025.10 | 66.5 | |
| LLaVA-1.5 + FG-CLIP 2Vision Encoder=FG-CLIP 2, LMM Base Architecture=LLaVA-1.52025.10 | 66.5 | |
| LLaVA-1.5 + SigLIP 2Vision Encoder=SigLIP 2, LMM Base Architecture=LLaVA-1.52025.10 | 64.8 | |
| Claude-3 Opusopen-source=false2024.04 | 63.3 | |
| Claude-3 Haikuopen-source=false2024.04 | 60.7 |