Image Captioning on Infrared-COCO (test)
72.87Semantic ConsistencyClean
Evaluation Results
| Method | Links | |
|---|---|---|
| CleanImage Encoder=EVA-CLIP ViT-G/14, Models=InstructBLIP FlanT5XL (4.1B)2026.04 | 72.87 | |
| CleanImage Encoder=EVA-CLIP ViT-G/14, Models=Blip-2 FlanT5XL (4.1B)2026.04 | 70.17 | |
| CleanImage Encoder=OpenAI CLIP ViT-L/14, Models=Blip-2 FlanT5XL ViT-L (3.4B)2026.04 | 68.87 | |
| CleanImage Encoder=OpenAI CLIP ViT-L/14, Models=LLaVA-1.6 (13B)2026.04 | 68.01 | |
| QR codeImage Encoder=EVA-CLIP ViT-G/14, Models=InstructBLIP FlanT5XL (4.1B)2026.04 | 66.77 | |
| CleanImage Encoder=OpenAI CLIP ViT-L/14, Models=LLaVA-1.5 (7B)2026.04 | 66.03 | |
| QR codeImage Encoder=EVA-CLIP ViT-G/14, Models=Blip-2 FlanT5XL (4.1B)2026.04 | 64.37 | |
| QR codeImage Encoder=OpenAI CLIP ViT-L/14, Models=Blip-2 FlanT5XL ViT-L (3.4B)2026.04 | 64.03 | |
| HCBImage Encoder=OpenAI CLIP ViT-L/14, Models=LLaVA-1.6 (13B)2026.04 | 63.94 | |
| AdvGridImage Encoder=OpenAI CLIP ViT-L/14, Models=LLaVA-1.6 (13B)2026.04 | 63.65 | |
| CleanImage Encoder=OpenAI CLIP ViT-L/14, Models=OpenFlamingo (3B)2026.04 | 63.17 | |
| HCBImage Encoder=EVA-CLIP ViT-G/14, Models=Blip-2 FlanT5XL (4.1B)2026.04 | 62.45 | |
| HCBImage Encoder=OpenAI CLIP ViT-L/14, Models=LLaVA-1.5 (7B)2026.04 | 61.99 | |
| QR codeImage Encoder=OpenAI CLIP ViT-L/14, Models=LLaVA-1.5 (7B)2026.04 | 61.59 | |
| QR codeImage Encoder=OpenAI CLIP ViT-L/14, Models=LLaVA-1.6 (13B)2026.04 | 61.09 | |
| AdvGridImage Encoder=OpenAI CLIP ViT-L/14, Models=LLaVA-1.5 (7B)2026.04 | 61 | |
| AdvGridImage Encoder=OpenAI CLIP ViT-L/14, Models=Blip-2 FlanT5XL ViT-L (3.4B)2026.04 | 60.96 | |
| HCBImage Encoder=EVA-CLIP ViT-G/14, Models=InstructBLIP FlanT5XL (4.1B)2026.04 | 60.63 | |
| AdvGridImage Encoder=EVA-CLIP ViT-G/14, Models=Blip-2 FlanT5XL (4.1B)2026.04 | 59.93 | |
| AdvGridImage Encoder=EVA-CLIP ViT-G/14, Models=InstructBLIP FlanT5XL (4.1B)2026.04 | 59.13 | |
| HCBImage Encoder=OpenAI CLIP ViT-L/14, Models=Blip-2 FlanT5XL ViT-L (3.4B)2026.04 | 58.91 | |
| QR codeImage Encoder=OpenAI CLIP ViT-L/14, Models=OpenFlamingo (3B)2026.04 | 58.37 | |
| AdvGridImage Encoder=OpenAI CLIP ViT-L/14, Models=OpenFlamingo (3B)2026.04 | 54.93 | |
| UCGPImage Encoder=EVA-CLIP ViT-G/14, Models=InstructBLIP FlanT5XL (4.1B)2026.04 | 53.35 | |
| UCGPImage Encoder=OpenAI CLIP ViT-L/14, Models=LLaVA-1.6 (13B)2026.04 | 52.77 | |
| UCGPImage Encoder=EVA-CLIP ViT-G/14, Models=Blip-2 FlanT5XL (4.1B)2026.04 | 51.77 | |
| HCBImage Encoder=OpenAI CLIP ViT-L/14, Models=OpenFlamingo (3B)2026.04 | 51.37 | |
| UCGPImage Encoder=OpenAI CLIP ViT-L/14, Models=Blip-2 FlanT5XL ViT-L (3.4B)2026.04 | 51.2 | |
| UCGPImage Encoder=OpenAI CLIP ViT-L/14, Models=LLaVA-1.5 (7B)2026.04 | 48.79 | |
| UCGPImage Encoder=OpenAI CLIP ViT-L/14, Models=OpenFlamingo (3B)2026.04 | 43.77 |