Text-to-Image Retrieval on DataComp 15M
74AccuracyOurs-FT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Ours-FTComparison Baseline=CLIP, Evaluation Judge=GPT-4V, LLM Rephrasing=false, System A Stages=1, System B Stages=12024.06 | 74 | 77.3 | |
| Ours-FTComparison Baseline=Ours-PT, Evaluation Judge=GPT-4V, LLM Rephrasing=false, System A Stages=1, System B Stages=12024.06 | 72 | 78.7 | |
| Ours-FTComparison Baseline=DataComp, Evaluation Judge=GPT-4V, LLM Rephrasing=false, System A Stages=1, System B Stages=12024.06 | 69.3 | 67.3 | |
| Ours-FTComparison Baseline=Ours-PT, Evaluation Judge=Human labeler, LLM Rephrasing=false, System A Stages=1, System B Stages=12024.06 | 65.3 | 74.7 |