General Multimodal Evaluation on MMBench EN (dev)
67.6AccuracyLLaVA-1.5 + FG-CLIP 2
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-1.5 + FG-CLIP 2Vision Encoder=FG-CLIP 2, LMM Base Architecture=LLaVA-1.52025.10 | 67.6 | |
| LLaVA-1.5 + Meta CLIP 2Vision Encoder=Meta CLIP 2, LMM Base Architecture=LLaVA-1.52025.10 | 66.5 | |
| LLaVA-1.5 + SigLIP 2Vision Encoder=SigLIP 2, LMM Base Architecture=LLaVA-1.52025.10 | 66.2 | |
| LLaVA-1.5 + CLIPVision Encoder=CLIP, LMM Base Architecture=LLaVA-1.52025.10 | 65.1 |