Cross-modal Retrieval on Multimodal Dataset
72.1Recall@10Vision-Enhanced LLM
Evaluation Results
| Method | Links | |
|---|---|---|
| Vision-Enhanced LLMComputational Efficiency (%)=802025.12 | 72.1 | |
| ImagenComputational Efficiency (%)=702025.12 | 60.7 | |
| DALL·E 2Computational Efficiency (%)=622025.12 | 58.2 | |
| Stable DiffusionComputational Efficiency (%)=652025.12 | 55.3 |