Loading the SOTA2 catalog…
Looking Similar, Sounding Different: Leveraging Counterfactual Cross-Modal Pairs for Audiovisual Representation Learning · SOTA2 Research