Image Captioning on MS COCO IR
68.44ScoreClean
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CleanImage Encoder=EVA-CLIP ViT-G/14, Model=InstructBLIP FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 68.44 | — | |
| CleanImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.6 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 68 | — | |
| CleanImage Encoder=OpenAI CLIP ViT-L/14, Model=OpenFlamingo (3B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 67.36 | — | |
| Unified PatchImage Encoder=EVA-CLIP ViT-G/14, Model=InstructBLIP FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 65.73 | 2.71 | |
| CleanImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.5 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 65.4 | — | |
| CleanImage Encoder=EVA-CLIP ViT-G/14, Model=Blip-2 FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 65.03 | — | |
| CleanImage Encoder=OpenAI CLIP ViT-L/14, Model=Blip-2 FlanT5XL ViT-L (3.4B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 62.19 | — | |
| Unified PatchImage Encoder=OpenAI CLIP ViT-L/14, Model=OpenFlamingo (3B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 61.6 | 5.76 | |
| TOUAPImage Encoder=EVA-CLIP ViT-G/14, Model=InstructBLIP FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 59.37 | 9.07 | |
| Unified PatchImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.5 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 58.87 | 6.53 | |
| Unified PatchImage Encoder=EVA-CLIP ViT-G/14, Model=Blip-2 FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 57.38 | 7.65 | |
| Unified PatchImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.6 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 57.17 | 10.83 | |
| Unified PatchImage Encoder=OpenAI CLIP ViT-L/14, Model=Blip-2 FlanT5XL ViT-L (3.4B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 57.09 | 5.1 | |
| TOUAPImage Encoder=OpenAI CLIP ViT-L/14, Model=OpenFlamingo (3B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 56.94 | 10.42 | |
| TOUAPImage Encoder=EVA-CLIP ViT-G/14, Model=Blip-2 FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 56.83 | 8.2 | |
| TOUAPImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.6 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 56.45 | 11.55 | |
| TOUAPImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.5 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 55.15 | 10.25 | |
| TOUAPImage Encoder=OpenAI CLIP ViT-L/14, Model=Blip-2 FlanT5XL ViT-L (3.4B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 54.26 | 7.93 | |
| CFGPatchImage Encoder=EVA-CLIP ViT-G/14, Model=InstructBLIP FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 52.91 | 15.53 | |
| CFGPatchImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.6 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 51.54 | 16.46 | |
| CFGPatchImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.5 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 50.25 | 15.15 | |
| CFGPatchImage Encoder=OpenAI CLIP ViT-L/14, Model=Blip-2 FlanT5XL ViT-L (3.4B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 49.12 | 13.07 | |
| CFGPatchImage Encoder=EVA-CLIP ViT-G/14, Model=Blip-2 FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 48.97 | 16.06 | |
| CFGPatchImage Encoder=OpenAI CLIP ViT-L/14, Model=OpenFlamingo (3B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 47.31 | 20.05 |