Loading the SOTA2 catalog…
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks · SOTA2 Research