Visual Question Answering on VIS-IR COCO Visible
68.41AccuracyClean
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CleanTarget Model=InstructBLIP FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 68.41 | — | |
| CleanTarget Model=OpenFlamingo (3B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 68.26 | — | |
| CleanTarget Model=Blip-2 FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 67.98 | — | |
| Unified PatchTarget Model=OpenFlamingo (3B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 66.74 | 1.52 | |
| Unified PatchTarget Model=InstructBLIP FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 66.73 | 1.68 | |
| Unified PatchTarget Model=Blip-2 FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 65.68 | 2.3 | |
| CleanTarget Model=LLaVA-1.5 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 65.38 | — | |
| TOUAPTarget Model=OpenFlamingo (3B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 64.11 | 4.15 | |
| TOUAPTarget Model=InstructBLIP FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 62.78 | 5.63 | |
| TOUAPTarget Model=Blip-2 FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 62.09 | 5.89 | |
| Unified PatchTarget Model=LLaVA-1.5 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 61.97 | 3.41 | |
| CleanTarget Model=LLaVA-1.6 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 61.75 | — | |
| TOUAPTarget Model=LLaVA-1.5 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 59.24 | 6.14 | |
| Unified PatchTarget Model=LLaVA-1.6 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 59.11 | 2.64 | |
| CleanTarget Model=Blip-2 FlanT5XL ViT-L (3.4B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 57.07 | — | |
| CFGPatchTarget Model=InstructBLIP FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 56.9 | 11.51 | |
| TOUAPTarget Model=LLaVA-1.6 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 56.24 | 5.51 | |
| CFGPatchTarget Model=OpenFlamingo (3B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 55.91 | 12.35 | |
| Unified PatchTarget Model=Blip-2 FlanT5XL ViT-L (3.4B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 53.92 | 3.15 | |
| CFGPatchTarget Model=LLaVA-1.5 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 52.81 | 12.57 | |
| CFGPatchTarget Model=Blip-2 FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 51.97 | 16.01 | |
| TOUAPTarget Model=Blip-2 FlanT5XL ViT-L (3.4B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 50.65 | 6.42 | |
| CFGPatchTarget Model=LLaVA-1.6 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 50.12 | 11.63 | |
| CFGPatchTarget Model=Blip-2 FlanT5XL ViT-L (3.4B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 42.77 | 14.3 |