Multimodal Performance Evaluation on LLaVA-Bench In-the-Wild
78.9General ScoreASMv2
Evaluation Results
| Method | Links | |
|---|---|---|
| ASMv2Model Scale=13B2024.02 | 78.9 | |
| INF-LLaVA*Source=Ours, larger_dataset=true2024.07 | 78.2 | |
| Video-LLaVALLM=V-7B, Res.=2242023.11 | 73.1 | |
| LLaVA-1.5Model Scale=13B2024.02 | 70.7 | |
| INF-LLaVASource=Ours2024.07 | 67.5 | |
| HoneybeeSource=CVPR’242024.07 | 67.1 | |
| LLaVA1.5Source=CVPR’242024.07 | 65.4 | |
| LoRA-SparseSource=CVPR’242024.07 | 63.4 | |
| LLaVA-1.5†LLM=V-7B, Res.=224, Encoder=LanguageBind-Image2023.11 | 63.3 | |
| LLaVASource=NeurIPS’232024.07 | 62.8 | |
| BLIP-22024.02 | 38.1 | |
| InstructBLIPModel Scale=13B2024.02 | 25.6 |