Visual Reasoning on NLVR2 (val)
91.1AccuracyLLaVA-NeXT-Interleave-14B
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-NeXT-Interleave-14BModel Scale=>14B2024.09 | 91.1 | |
| MM1.5-30BModel Scale=>14B2024.09 | 90.6 | |
| Mantis-Idefics2-8BModel Scale=7B2024.09 | 89.7 | |
| LLaVA-NeXT-Interleave-7BModel Scale=7B2024.09 | 88.8 | |
| GPT-4VModel Scale=>14B2024.09 | 88.8 | |
| Idefics2-8BModel Scale=7B2024.09 | 86.9 | |
| MM1.5-7BModel Scale=7B2024.09 | 86.9 | |
| MM1.5-3B-MoEModel Scale=3B2024.09 | 86 | |
| MM1.5-3BModel Scale=3B2024.09 | 83.8 | |
| MM1.5-1B-MoEModel Scale=1B2024.09 | 83.2 | |
| MM1.5-1BModel Scale=1B2024.09 | 79 | |
| LLaVA-NeXT-Interleave-0.5BModel Scale=1B2024.09 | 67.8 | |
| LLaVAOneVision-0.5BModel Scale=1B2024.09 | 63.4 | |
| MM1-30BModel Scale=>14B2024.09 | 63.1 | |
| MM1-7BModel Scale=7B2024.09 | 59.9 | |
| Emu2-Chat-37BModel Scale=>14B2024.09 | 58.2 | |
| LLaVA-v1.5-7BModel Scale=7B2024.09 | 53.9 | |
| Phi-3-Vision-4BModel Scale=3B2024.09 | 53.6 | |
| MM1-3BModel Scale=3B2024.09 | 51.7 | |
| MM1-1BModel Scale=1B2024.09 | 50.9 |