Image Captioning on COMPOSITIONCAP (test)
47.5ROUGE-LQwen2.5-VL-7B + TDSR
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen2.5-VL-7B + TDSRBackbone=Qwen2.5-VL-7B, Refinement=TDSR2025.10 | 47.5 | 19.7 | 27.5 | 129.4 | 88.9 | |
| LLaVA-1.5-7B + TDSRBackbone=LLaVA-1.5-7B, Refinement=TDSR2025.10 | 44.3 | 16.6 | 23.5 | 124.2 | 82.5 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2025.10 | 41.2 | 14.5 | 21.9 | 120.3 | 81.3 | |
| VistaLLM-13BBackbone=VistaLLM-13B2025.10 | 40.9 | 14.1 | 21.4 | 117.5 | 80.2 | |
| FINECAPTION-8BBackbone=FINECAPTION-8B2025.10 | 40.6 | 13.9 | 20.9 | 118.6 | 79.5 | |
| Alpha-CLIP-13BBackbone=Alpha-CLIP-13B2025.10 | 35.6 | 10.9 | 19.3 | 93.9 | 77.7 | |
| LLaVA-1.5-7B+Patch MattersBackbone=LLaVA-1.5-7B, Augmentation=Patch Matters2025.10 | 34.6 | 12.5 | 21.2 | 118.8 | 79.1 | |
| Ferret-13BBackbone=Ferret-13B2025.10 | 33.6 | 12.8 | 19.6 | 114.6 | 79.1 | |
| LLaVA-1.5-7B+ITBackbone=LLaVA-1.5-7B, Augmentation=Instruction Tuning2025.10 | 32.9 | 10.6 | 15.7 | 95.2 | 78.2 | |
| Shikra-13BBackbone=Shikra-13B2025.10 | 32.4 | 11.9 | 19.5 | 108.4 | 78.4 | |
| MiniGPT-v2-7BBackbone=MiniGPT-v2-7B2025.10 | 31.9 | 11.5 | 18.7 | 106.2 | 78.2 | |
| VisionLLM-H-7BBackbone=VisionLLM-H-7B2025.10 | 31.2 | 10.7 | 15.4 | 90.2 | 76.5 | |
| KOSMOS-2Backbone=KOSMOS-22025.10 | 30.8 | 10.1 | 14.9 | 88.9 | 76.7 | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B2025.10 | 30.3 | 8.6 | 11.4 | 86.5 | 73.2 |