Multi-modal Multi-image Reasoning on MMT (val)
67.4AccuracyInternVL2-Llama3-76B
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL2-Llama3-76BModel Size=76B, Backbone=Llama32026.01 | 67.4 | |
| GPT-4VModel Size=Proprietary2026.01 | 64.3 | |
| Qwen2VL-7BModel Size=7B2026.01 | 61.7 | |
| InternVL2-8BModel Size=8B2026.01 | 57.9 | |
| LLaVA-OV-7BModel Size=7B2026.01 | 56.6 | |
| Ours (masked) (LLaVA-OV-7B)Model Size=7B, Backbone=LLaVA-OV, Attention Masking=True2026.01 | 55.3 | |
| Qwen2VL-2BModel Size=2B2026.01 | 51.9 | |
| Ours (LLaVA-OV-1.5B)Model Size=1.5B, Backbone=LLaVA-OV, Attention Masking=False2026.01 | 48.8 | |
| Ours (masked) (LLaVA-OV-1.5B)Model Size=1.5B, Backbone=LLaVA-OV, Attention Masking=True2026.01 | 48.1 | |
| LLaVA-OV-1.5BModel Size=1.5B2026.01 | 47.5 | |
| InternVL2-2BModel Size=2B2026.01 | 46.7 | |
| Ours (masked) (LLaVA-OV-0.5B)Model Size=0.5B, Backbone=LLaVA-OV, Attention Masking=True2026.01 | 45.9 | |
| Ours (LLaVA-OV-0.5B)Model Size=0.5B, Backbone=LLaVA-OV, Attention Masking=False2026.01 | 45.6 | |
| LLaVA-OV-0.5BModel Size=0.5B2026.01 | 41.1 |