Visual Question Answering on VIS-IR COCO Infrared
64.72AccuracyClean
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CleanTarget Model=InstructBLIP FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 64.72 | — | |
| CleanTarget Model=OpenFlamingo (3B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 63.58 | — | |
| CleanTarget Model=Blip-2 FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 63.15 | — | |
| CleanTarget Model=LLaVA-1.5 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 62.27 | — | |
| Unified PatchTarget Model=InstructBLIP FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 61.45 | 3.27 | |
| Unified PatchTarget Model=OpenFlamingo (3B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 60.73 | 2.85 | |
| Unified PatchTarget Model=Blip-2 FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 59.4 | 3.75 | |
| Unified PatchTarget Model=LLaVA-1.5 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 58.73 | 3.54 | |
| TOUAPTarget Model=OpenFlamingo (3B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 57.46 | 6.12 | |
| TOUAPTarget Model=InstructBLIP FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 56.87 | 7.85 | |
| TOUAPTarget Model=LLaVA-1.5 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 54.74 | 7.53 | |
| CleanTarget Model=LLaVA-1.6 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 54.64 | — | |
| TOUAPTarget Model=Blip-2 FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 54.58 | 8.57 | |
| CFGPatchTarget Model=OpenFlamingo (3B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 53.02 | 10.56 | |
| Unified PatchTarget Model=LLaVA-1.6 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 53.01 | 1.63 | |
| CleanTarget Model=Blip-2 FlanT5XL ViT-L (3.4B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 52.46 | — | |
| CFGPatchTarget Model=InstructBLIP FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 51.6 | 13.12 | |
| CFGPatchTarget Model=LLaVA-1.5 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 49.8 | 12.47 | |
| TOUAPTarget Model=LLaVA-1.6 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 49.12 | 5.52 | |
| Unified PatchTarget Model=Blip-2 FlanT5XL ViT-L (3.4B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 48.7 | 3.76 | |
| CFGPatchTarget Model=Blip-2 FlanT5XL (4.1B), Image Encoder=EVA-CLIP ViT-G/142026.05 | 45.9 | 17.25 | |
| TOUAPTarget Model=Blip-2 FlanT5XL ViT-L (3.4B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 45.72 | 6.74 | |
| CFGPatchTarget Model=LLaVA-1.6 (7B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 42.58 | 12.06 | |
| CFGPatchTarget Model=Blip-2 FlanT5XL ViT-L (3.4B), Image Encoder=OpenAI CLIP ViT-L/142026.05 | 39.26 | 13.2 |