Loading the SOTA2 catalog…
Hierarchical Pre-Training of Vision Encoders with Large Language Model · SOTA2 Research