Loading the SOTA2 catalog…
Cross-aware Early Fusion with Stage-divided Vision and Language Transformer Encoders for Referring Image Segmentation · SOTA2 Research