Loading the SOTA2 catalog…
DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering · SOTA2 Research