Loading the SOTA2 catalog…
GCS-M3VLT: Guided Context Self-Attention based Multi-modal Medical Vision Language Transformer for Retinal Image Captioning · SOTA2 Research