Loading the SOTA2 catalog…
KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering · SOTA2 Research