Image Captioning on FAIRFACE (val)
0.64Score (White)Baseline CLIP
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Baseline CLIPCaptioning Model=ClipCap, Vision Encoder=ViT-B/322024.11 | 0.64 | 0.495 | 0.568 | 0.534 | 0.525 | 0.656 | 0.624 | 0.161 | |
| BEND-VLMCaptioning Model=ClipCap, Vision Encoder=ViT-B/322024.11 | 0.355 | 0.29 | 0.36 | 0.321 | 0.309 | 0.385 | 0.355 | 0.095 |