Multimodal Evaluation on MMBench-CN (test)
61.4AccuracyLLaVA-1.5 + FG-CLIP 2
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-1.5 + FG-CLIP 2Vision Encoder=FG-CLIP 2, LMM Base Architecture=LLaVA-1.52025.10 | 61.4 | |
| LLaVA-1.5 + Meta CLIP 2Vision Encoder=Meta CLIP 2, LMM Base Architecture=LLaVA-1.52025.10 | 60.3 | |
| LLaVA-1.5 + CLIPVision Encoder=CLIP, LMM Base Architecture=LLaVA-1.52025.10 | 58.4 | |
| LLaVA-1.5 + SigLIP 2Vision Encoder=SigLIP 2, LMM Base Architecture=LLaVA-1.52025.10 | 57.2 | |
| InternVL 1.5#param=26B, open-source=false2024.04 | 0.82 | |
| InternVL 1.2#param=40B, open-source=false2024.04 | 0.812 | |
| Step-1V#param=100B, open-source=false2024.04 | 0.799 | |
| LLaVA-NeXT#param=35B, open-source=false2024.04 | 0.79 | |
| HPT Proopen-source=false2024.04 | 0.767 | |
| Qwen-VL-Maxopen-source=false2024.04 | 0.757 | |
| GPT-4Vopen-source=false2024.04 | 0.744 | |
| Gemini Pro 1.0open-source=false2024.04 | 0.743 | |
| Qwen-VL-Plusopen-source=false2024.04 | 0.707 | |
| Claude-3 Sonnetopen-source=false2024.04 | 0.642 | |
| Claude-3 Opusopen-source=false2024.04 | 0.592 | |
| Claude-3 Haikuopen-source=false2024.04 | 0.572 |