Vision-Language Compositional Evaluation on CC3M 50,000 random subset TripletData
92.25Text ScoreTripletCLIP
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TripletCLIPPre-training Data=CC12M2024.11 | 92.25 | 66.82 | 64.3 | |
| NegCLIPPre-training Data=CC12M2024.11 | 54.84 | 30.42 | 25.82 | |
| CLIPPre-training Data=CC12M2024.11 | 52.69 | 29.66 | 24.64 | |
| NegCLIP++Pre-training Data=CC12M2024.11 | 36.5 | 30.67 | 20.11 |