Image Captioning on MS COCO VIS
85.68ScoreClean
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CleanImage Encoder=OpenAI CLIP ViT-L/14, Model=Blip-2 FlanT5XL ViT-L (3.4B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 85.68 | — | |
| Unified PatchImage Encoder=OpenAI CLIP ViT-L/14, Model=Blip-2 FlanT5XL ViT-L (3.4B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 83.95 | 1.73 | |
| CleanImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.6 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 82.37 | — | |
| Unified PatchImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.6 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 81.12 | 1.25 | |
| CleanImage Encoder=OpenAI CLIP ViT-L/14, Model=OpenFlamingo (3B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 79.46 | — | |
| TOUAPImage Encoder=OpenAI CLIP ViT-L/14, Model=Blip-2 FlanT5XL ViT-L (3.4B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 79.4 | 6.28 | |
| CleanImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.5 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 78.53 | — | |
| Unified PatchImage Encoder=OpenAI CLIP ViT-L/14, Model=OpenFlamingo (3B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 77.94 | 1.52 | |
| CleanImage Encoder=EVA-CLIP ViT-G/14, Model=InstructBLIP FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 77.56 | — | |
| Unified PatchImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.5 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 76 | 2.53 | |
| CFGPatchImage Encoder=OpenAI CLIP ViT-L/14, Model=Blip-2 FlanT5XL ViT-L (3.4B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 75.65 | 10.03 | |
| Unified PatchImage Encoder=EVA-CLIP ViT-G/14, Model=InstructBLIP FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 75.64 | 1.92 | |
| CleanImage Encoder=EVA-CLIP ViT-G/14, Model=Blip-2 FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 75.38 | — | |
| TOUAPImage Encoder=EVA-CLIP ViT-G/14, Model=InstructBLIP FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 72.11 | 5.45 | |
| TOUAPImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.5 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 71.95 | 6.58 | |
| Unified PatchImage Encoder=EVA-CLIP ViT-G/14, Model=Blip-2 FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 71.89 | 3.49 | |
| TOUAPImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.6 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 71.25 | 11.12 | |
| TOUAPImage Encoder=OpenAI CLIP ViT-L/14, Model=OpenFlamingo (3B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 71.2 | 8.26 | |
| CFGPatchImage Encoder=EVA-CLIP ViT-G/14, Model=InstructBLIP FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 69.81 | 7.75 | |
| CFGPatchImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.6 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 67.2 | 15.17 | |
| CFGPatchImage Encoder=OpenAI CLIP ViT-L/14, Model=LLaVA-1.5 (7B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 65.39 | 13.14 | |
| CFGPatchImage Encoder=OpenAI CLIP ViT-L/14, Model=OpenFlamingo (3B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 64.53 | 14.93 | |
| TOUAPImage Encoder=EVA-CLIP ViT-G/14, Model=Blip-2 FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 63.84 | 11.54 | |
| CFGPatchImage Encoder=EVA-CLIP ViT-G/14, Model=Blip-2 FlanT5XL (4.1B), Evaluation Protocol=LLM-as-Judge (GPT-5)2026.05 | 60.92 | 14.46 |