Loading the SOTA2 catalog…
Unsupervised Vision-and-Language Pre-training via Retrieval-based Multi-Granular Alignment · SOTA2 Research