Loading the SOTA2 catalog…
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering · SOTA2 Research