Loading the SOTA2 catalog…
ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning · SOTA2 Research