Fine-grained Visual Reasoning on V* Benchmark
45.2ARLLaVA-1.5 + FG-CLIP 2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LLaVA-1.5 + FG-CLIP 2Vision Encoder=FG-CLIP 2, LMM Base Architecture=LLaVA-1.52025.10 | 45.2 | 57.9 | 50.3 | |
| LLaVA-1.5 + CLIPVision Encoder=CLIP, LMM Base Architecture=LLaVA-1.52025.10 | 44.4 | 52.6 | 47.6 | |
| LLaVA-1.5 + SigLIP 2Vision Encoder=SigLIP 2, LMM Base Architecture=LLaVA-1.52025.10 | 40.9 | 56.6 | 47.1 | |
| LLaVA-1.5 + Meta CLIP 2Vision Encoder=Meta CLIP 2, LMM Base Architecture=LLaVA-1.52025.10 | 39.1 | 54 | 45 |