Multi-modal Understanding on Q-Bench (test)
62.9Overall ScoremPLUG-Owl2
Evaluation Results
| Method | Links | |
|---|---|---|
| mPLUG-Owl2Vision Encoder=ViT-L (0.3B), Language Model=LLAMA (7B), Zero-shot=true2023.11 | 62.9 | |
| Qwen-VL-ChatVision Encoder=ViT-G (1.9B), Language Model=Qwen (7B), Zero-shot=true2023.11 | 61.6 | |
| LLaVA-1.5Vision Encoder=ViT-L (0.3B), Language Model=Vicuna (7B), Zero-shot=true2023.11 | 60.7 | |
| mPLUG-OwlVision Encoder=ViT-L (0.3B), Language Model=LLaMA (7B), Zero-shot=true2023.11 | 58.9 | |
| LLaMA-Adapter-v2Vision Encoder=ViT-L (0.3B), Language Model=LLaMA (7B), Zero-shot=true2023.11 | 58.1 | |
| InstructBLIPVision Encoder=ViT-g (1.3B), Language Model=Vicuna (7B), Zero-shot=true2023.11 | 55.8 | |
| LLaVAVision Encoder=ViT-L (0.3B), Language Model=Vicuna (7B), Zero-shot=true2023.11 | 54.7 | |
| OtterVision Encoder=ViT-L (0.3B), Language Model=LLaMA (7B), Zero-shot=true2023.11 | 47.2 |