Multimodal Understanding on SEED Image
77.1AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o2024.09 | 77.1 | |
| EMOVAModel Size=72B2024.09 | 76.6 | |
| InternVL 1.5#param=26B, open-source=false2024.04 | 76 | |
| LLaVA-NeXT#param=35B, open-source=false2024.04 | 75.9 | |
| InternVL 1.2#param=40B, open-source=false2024.04 | 75.6 | |
| EMOVAModel Size=7B2024.09 | 75.5 | |
| EMOVAModel Size=3B2024.09 | 74.9 | |
| VITAModel Size=1.52024.09 | 74.2 | |
| Baichuan-OmniModel Size=7B2024.09 | 74.1 | |
| Qwen-VL-Plusopen-source=false2024.04 | 72.7 | |
| VITAModel Size=8x7B2024.09 | 72.6 | |
| GPT-4Vopen-source=false2024.04 | 71.6 | |
| Gemini Pro 1.52024.09 | 71.6 | |
| Gemini Pro 1.0open-source=false2024.04 | 70.7 | |
| Step-1V#param=100B, open-source=false2024.04 | 70.3 |