Multi-Image Understanding on MuirBench (test)
68AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o2024.12 | 68 | |
| GPT-4V2024.12 | 62.3 | |
| GPT-4V2026.01 | 62.3 | |
| InternVL-2-8BBackbone=8B2024.12 | 59.4 | |
| MAmmoTH-VL-8BBackbone=8B2024.12 | 55.1 | |
| LLaVA-OV-72BBackbone=72B2024.12 | 54.8 | |
| attention-masking strategybackbone=LLaVA-OV-7B, attention masking=true2026.01 | 51.3 | |
| InternVL2-Llama3-76B2026.01 | 51.2 | |
| Qwen2VL-7B2026.01 | 43 | |
| LLaVA-OV-7BBackbone=7B2024.12 | 41.8 | |
| LLaVA-OV-7B2026.01 | 41.7 | |
| Qwen2-VL-7B-Ins.Backbone=7B-Instruct2024.12 | 41.6 | |
| InternVL2-8B2026.01 | 37.9 | |
| procedural data-generation strategybackbone=LLaVA-OV-0.5B, attention masking=false2026.01 | 33.6 | |
| LLaVA-OV-72Bvariant=Single-Image (SI), Backbone=72B2024.12 | 33.2 | |
| LLaVA-OV-7Bvariant=Single-Image (SI), Backbone=7B2024.12 | 32.7 | |
| attention-masking strategybackbone=LLaVA-OV-0.5B, attention masking=true2026.01 | 32.5 | |
| Qwen2VL-2B2026.01 | 27.2 | |
| LLaVA-OV-0.5B2026.01 | 26.8 | |
| InternVL2-2B2026.01 | 24.3 | |
| LLaVA-v1.5-7B2026.01 | 20 |