Text-to-Image Retrieval on DeepEyeNet (unseen)
9,395R@1Knowledge-Enhanced Multimodal Transformer
Evaluation Results
| Method | Links | |
|---|---|---|
| Knowledge-Enhanced Multimodal TransformerTraining dataset=BRSET, Evaluation Mode=Zero-shot2025.12 | 9,395 | |
| CLIPTraining dataset=BRSET, Protocol=Fine-tuned, Evaluation Mode=Zero-shot2025.12 | 22 |