Multimodal Question Answering on PIVOT Evaluation Suite
62Overall AccuracyLLaVA-Next-Qwen2
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| LLaVA-Next-Qwen2LLM size=7B2025.10 | 62 | 70.5 | 63.3 | 62.3 | 53.3 | |
| LLaVA-Next-LLaMA-3LLM size=8B2025.10 | 60.4 | 71.3 | 64.3 | 57.5 | 49 | |
| PIVOTLLM size=1.5B, Vision Encoder=SigLIP2-So/162025.10 | 55.6 | 68.1 | 53.9 | 52.4 | 48.1 | |
| PIVOTLLM size=1.5B, Vision Encoder=SigLIP1-So/162025.10 | 53.2 | 67.7 | 46.8 | 51.7 | 46.6 | |
| LLaVA-Next-VincinaLLM size=7B2025.10 | 50.6 | 68.3 | 38 | 52.8 | 43.9 | |
| LLaVA-OneVisionLLM size=0.5B2025.10 | 50 | 60.4 | 57 | 42.7 | 39.4 | |
| SPHINXLLM size=7B2025.10 | 48.7 | 65.6 | 33.2 | 52.5 | 41.4 | |
| BLIP-2LLM size=7B2025.10 | 43.7 | 48.5 | 52.8 | 31 | 42.5 | |
| SPHINX-TinyLLM size=1.1B2025.10 | 37.5 | 54.2 | 19.3 | 43.6 | 33.2 |