Multimodal Question Answering on MMBench (test)
64.3ScoreLLaVA-v1.5
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-v1.5Size=7.2B, Visual Tokens=576, GFLOPs=80272024.05 | 64.3 | |
| VLORASize=7.8B, Visual Tokens=0, GFLOPs=6192024.05 | 63.4 | |
| Qwen-VL-ChatSize=9.6B, Visual Tokens=256, GFLOPs=37542024.05 | 60.6 | |
| Idefics-instructSize=9B, Visual Tokens=64, GFLOPs=13622024.05 | 48.2 | |
| Qwen-VLSize=9.6B, Visual Tokens=256, GFLOPs=37542024.05 | 38.2 | |
| InstructBLIPSize=8B, Visual Tokens=32, GFLOPs=8272024.05 | 36 | |
| MiniGPT-4-v2Size=7B, Visual Tokens=256, GFLOPs=37542024.05 | 24.3 | |
| MiniGPT-4-v1Size=7B, Visual Tokens=32, GFLOPs=8272024.05 | 12.2 | |
| OpenFlamingo v2Size=9B, Visual Tokens=64, GFLOPs=13622024.05 | 6.6 |