Visual Reasoning on FOIL 30K captions derived from COCO
84.3Object AccuracyMID
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MIDCLIP Backbone=ViT-L/142022.05 | 84.3 | 44.3 | 48.1 | 45.7 | |
| MIDCLIP Backbone=ViT-B/322022.05 | 79.2 | 29 | 33.2 | 28 | |
| InfoNCECLIP Backbone=ViT-L/142022.05 | 67.5 | 23 | 28.4 | 24.3 | |
| CLIP-SCLIP Backbone=ViT-L/142022.05 | 58.5 | 15.7 | 20.9 | 16.9 | |
| InfoNCECLIP Backbone=ViT-B/322022.05 | 41.6 | 4.2 | 9.4 | 4.9 | |
| SOACLIP Backbone=ViT-B/322022.05 | 36.7 | 2.8 | 3.9 | 3.5 | |
| SOACLIP Backbone=ViT-L/142022.05 | 36.5 | 3 | 3.5 | 3 | |
| CLIP-SCLIP Backbone=ViT-B/322022.05 | 31.8 | 2.6 | 6.8 | 2.5 | |
| CLIP-R-PrecisionCLIP Backbone=ViT-L/142022.05 | 23.8 | 4.6 | 5.8 | 4.1 | |
| CLIP-R-PrecisionCLIP Backbone=ViT-B/322022.05 | 16.8 | 1.6 | 3.1 | 1.9 |