Multimodal Question Answering on CCBench
41.2ScoreQwen-VL-Chat
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen-VL-ChatSize=9.6B, Visual Tokens=256, GFLOPs=37542024.05 | 41.2 | |
| VLORASize=7.8B, Visual Tokens=0, GFLOPs=6192024.05 | 28.6 | |
| LLaVA-v1.5Size=7.2B, Visual Tokens=576, GFLOPs=80272024.05 | 27.5 | |
| InstructBLIPSize=8B, Visual Tokens=32, GFLOPs=8272024.05 | 12.7 | |
| Idefics-instructSize=9B, Visual Tokens=64, GFLOPs=13622024.05 | 7.8 | |
| OpenFlamingo v2Size=9B, Visual Tokens=64, GFLOPs=13622024.05 | 6.3 | |
| Qwen-VLSize=9.6B, Visual Tokens=256, GFLOPs=37542024.05 | 6.1 | |
| MiniGPT-4-v1Size=7B, Visual Tokens=32, GFLOPs=8272024.05 | 1.8 | |
| MiniGPT-4-v2Size=7B, Visual Tokens=256, GFLOPs=37542024.05 | 1.4 |