Multimodal Understanding on SEED-Bench 1
73.5Image AccuracyBunny-8B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Bunny-8BSize=4B < Size < 8B2024.02 | 73.5 | 66.2 | |
| VILA1.5-13BSize=> 8B2024.02 | 72.6 | 65.1 | |
| Bunny-4BSize=Size < 4B2024.02 | 72.5 | 64.9 | |
| LLaVA-NeXT-13BSize=> 8B2024.02 | 71.9 | — | |
| GPT-4V-1106Size=> 8B2024.02 | 71.6 | — | |
| ShareGPT4V-13BSize=> 8B2024.02 | 70.8 | — | |
| DeepSeek-VL-7BSize=4B < Size < 8B2024.02 | 70.4 | — | |
| LLaVA-NeXT-7BSize=4B < Size < 8B2024.02 | 70.2 | — | |
| MM1-7B-ChatSize=4B < Size < 8B2024.02 | 69.9 | 64 | |
| Mipha-3BSize=Size < 4B2024.02 | 68.9 | — | |
| SPHINX-Intern2Size=4B < Size < 8B2024.02 | 68.8 | — | |
| MM1-3B-ChatSize=Size < 4B2024.02 | 68.8 | 63 | |
| VILA1.5-3BSize=Size < 4B2024.02 | 67.9 | 60.9 | |
| Yi-VL-6BSize=4B < Size < 8B2024.02 | 67.6 | — | |
| MiniCPM-V 2.0Size=Size < 4B2024.02 | 67.1 | — | |
| InstructBLIP-Vicuna-7BSize=4B < Size < 8B2024.02 | — | 53.4 | |
| LLaVA-v1.5-13B (LORA)Size=> 8B2024.02 | — | 61.3 | |
| LLaVA-v1.5-7B (LORA)Size=4B < Size < 8B2024.02 | — | 60.1 | |
| LVIS-INSTRUCT4V-13BSize=> 8B2024.02 | — | 61.6 | |
| mPLUG-Owl2Size=4B < Size < 8B2024.02 | — | 57.8 | |
| SVIT-v1.5-13BSize=> 8B2024.02 | — | 61.9 |