Visual Perception on SEED-Bench Image
73.7AccuracyMG-LLaVA
Evaluation Results
| Method | Links | |
|---|---|---|
| MG-LLaVALLM=Yi1.5-34B, Params.=34.4B, Res.=336 (768)2024.06 | 73.7 | |
| GPT-4V2024.06 | 72.3 | |
| SPHINX-1kLLM=Vicuna-7B, Params.=10B, Res.=4482024.06 | 71.6 | |
| MG-LLaVALLM=LLaMA3-8B, Params.=8.4B, Res.=336 (768)2024.06 | 71.5 | |
| MG-LLaVALLM=Vicuna-13B, Params.=13.6B, Res.=336 (768)2024.06 | 70.8 | |
| GeminiPro Vision2024.06 | 70.7 | |
| MG-LLaVALLM=Phi3-3.8B, Params.=4.2B, Res.=336 (768)2024.06 | 70.2 | |
| MG-LLaVALLM=Vicuna-7B, Params.=7.4B, Res.=336 (768)2024.06 | 69.4 | |
| SPHINXLLM=Vicuna-7B, Params.=10B, Res.=2242024.06 | 69.1 | |
| LLaVA-1.5LLM=Vicuna-13B, Params.=13.4B, Res.=3362024.06 | 68.2 | |
| MiniCPM-V2LLM=MiniCPM-2.4B, Params.=2.8B, Res.=4482024.06 | 67.1 | |
| LLaVA-1.5LLM=Vicuna-7B, Params.=7.2B, Res.=3362024.06 | 66.1 | |
| Qwen-VL-Plus2024.06 | 65.7 | |
| LLaVA-HRLLM=Vicuna-13B, Params.=13.4B, Res.=448 (1024)2024.06 | 64.5 | |
| Qwen-VL-ChatLLM=Qwen-7B, Params.=9.6B, Res.=4482024.06 | 58.2 | |
| Qwen-VLLLM=Qwen-7B, Params.=9.6B, Res.=4482024.06 | 56.3 | |
| InstructBLIPLLM=Vicuna-7B, Params.=8.2B, Res.=2242024.06 | 53.4 | |
| BLIP-2LLM=Vicuna-13B, Params.=14.2B, Res.=2242024.06 | 46.4 |