Multi-image Understanding on MuirBench Multi-image Understanding
62.3AccuracyGPT-4V
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4VProprietary=true2025.12 | 62.3 | |
| Qwen2.5-VL-7BParameters=7B2025.12 | 58.2 | |
| InternVL-2.5-8BParameters=8B2025.12 | 51.2 | |
| SDAR-VL-8B-InstParameters=8B, Training=Instruction-tuned, Controlled Group=true2025.12 | 50.2 | |
| InternVL-2-8BParameters=8B2025.12 | 48.5 | |
| LLaDA-V-8BParameters=8B, Controlled Group=true2025.12 | 48.3 | |
| Qwen2.5-VL-3BParameters=3B2025.12 | 46.5 | |
| InternVL-2.5-4BParameters=4B2025.12 | 45.1 | |
| SDAR-VL-4B-InstParameters=4B, Training=Instruction-tuned, Controlled Group=true2025.12 | 44.8 | |
| LLaVA-OV-7BParameters=7B2025.12 | 40.5 | |
| InternVL-2-4BParameters=4B2025.12 | 40.3 | |
| Qwen2-VL-7BParameters=7B2025.12 | 39.9 | |
| GPT-4oLLM Backbone=N/A, Open Data=false2025.12 | 0.68 | |
| MAmmoTH-VLLLM Backbone=Qwen2.5-7B, Open Data=true2025.12 | 0.551 | |
| Dream-VLLLM Backbone=Dream 7B, Open Data=true2025.12 | 0.512 | |
| LLaDA-VLLM Backbone=LLaDA 8B, Open Data=true2025.12 | 0.483 | |
| LLaVA-OVLLM Backbone=Qwen2-7B, Open Data=true2025.12 | 0.418 |