Image Captioning on MM-IT-Cap
15.7CIDErAnyMAL 70B (ViT-G)
Evaluation Results
| Method | Links | |
|---|---|---|
| AnyMAL 70B (ViT-G)Zero-shot=true, LLM size=70B, Vision Backbone=ViT-G2023.09 | 15.7 | |
| AnyMAL 13B (ViT-G)Zero-shot=true, LLM size=13B, Vision Backbone=ViT-G2023.09 | 15.5 | |
| LLaVAZero-shot=true2023.09 | 14.3 | |
| MiniGPT4Zero-shot=true2023.09 | 14.1 | |
| BLIP-2Zero-shot=true2023.09 | 2.9 | |
| OpenFlamingo-v2 9BZero-shot=true, Model size=9B2023.09 | 1.8 |