Image Captioning on TRINS-Cap
37.7BLEU-1LaRA
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| LaRABackbone=Vicuna-13B2024.06 | 37.7 | 26.4 | 18.9 | 14.2 | 18.4 | 33.2 | 46.7 | |
| LLaVAR (fine-tuned)Backbone=Vicuna-13B, fine-tuned=true2024.06 | 36.5 | 25.4 | 18 | 13.4 | 17.8 | 32.4 | 35.7 | |
| LLaVABackbone=Vicuna-13B2024.06 | 35.1 | 18.2 | 9.5 | 5.4 | 13.2 | 22.2 | 8.8 | |
| Mini-GPT4Backbone=Vicuna-13B2024.06 | 31.1 | 16.1 | 8.6 | 5 | 11.4 | 20.8 | 6.3 | |
| LLaVA 1.5Backbone=Vicuna-13B2024.06 | 31.1 | 16.4 | 9.5 | 6.1 | 11.9 | 21.8 | 15.4 | |
| LaRABackbone=Vicuna-13B, zero-shot=true2024.06 | 29.3 | 19.1 | 12.9 | 9.2 | 14.8 | 26.3 | 21.3 | |
| Qwen-VLBackbone=Qwen-7B2024.06 | 28.8 | 18.4 | 12.2 | 8.6 | 14.1 | 24.3 | 16.6 | |
| Mini-GPT-v2Backbone=Vicuna-13B2024.06 | 27.9 | 14.7 | 8 | 4.8 | 10.8 | 20.9 | 7.3 | |
| LLaVAR w/ OCRBackbone=Vicuna-13B, w/ OCR=true2024.06 | 21.4 | 13.1 | 8.8 | 6.4 | 12 | 22.2 | 13 | |
| LLaVARBackbone=Vicuna-13B2024.06 | 18.9 | 11.2 | 7.2 | 5 | 10.8 | 20.1 | 11.4 | |
| Instruct-BLIPBackbone=Vicuna-13B2024.06 | 15.9 | 9.9 | 6.4 | 4.4 | 9.6 | 18.6 | 8 | |
| Instruct-BLIPBackbone=Vicuna-7B2024.06 | 13.4 | 8.5 | 5.7 | 4.1 | 9.2 | 17.9 | 5.7 | |
| mPLUG-Owl2Backbone=Llama-2-7B2024.06 | 4.9 | 3.2 | 2.3 | 1.7 | 8.7 | 19.6 | 4.5 |