Text-Image Retrieval on repurposed DOTA Level 1 Complexity (test)
12R@1RUNE
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| RUNEImage Backbone=YOLO11, Text Backbone=GPT-4o2025.12 | 12 | 35 | 53 | 33 | 100 | 87 | 78 | 88 | |
| OpenCLIPImage Backbone=ViT-L-14, Text Backbone=Transformer2025.12 | 8 | 22 | 36 | 22 | 80 | 61 | 56 | 66 | |
| RemoteCLIPImage Backbone=ViT-B-32, Text Backbone=Transformer2025.12 | 7 | 27 | 44 | 26 | 63 | 69 | 61 | 64 | |
| RemoteCLIPImage Backbone=ViT-L-14, Text Backbone=Transformer2025.12 | 7 | 29 | 42 | 26 | 63 | 64 | 55 | 61 | |
| RemoteCLIPImage Backbone=RN50, Text Backbone=Transformer2025.12 | 6 | 24 | 42 | 24 | 50 | 57 | 57 | 55 | |
| GeoRSCLIPImage Backbone=ViT-B-32, Text Backbone=Transformer2025.12 | 6 | 20 | 32 | 19 | 50 | 49 | 46 | 48 | |
| OpenCLIPImage Backbone=RN50, Text Backbone=Transformer2025.12 | 6 | 18 | 29 | 18 | 70 | 54 | 47 | 57 | |
| OpenCLIPImage Backbone=ViT-B-32, Text Backbone=Transformer2025.12 | 4 | 21 | 33 | 20 | 70 | 57 | 48 | 58 | |
| CLIPImage Backbone=ViT-B-32, Text Backbone=Transformer2025.12 | 4 | 21 | 33 | 20 | 70 | 57 | 48 | 58 | |
| RS-LLaVAImage Backbone=CLIP-ViT-L-336px, Text Backbone=Mistral-7B2025.12 | 3 | 17 | 24 | 15 | 53 | 48 | 35 | 45 | |
| LLaVA-1.6Image Backbone=CLIP-ViT-L-336px, Text Backbone=GPT-42025.12 | 2 | 11 | 17 | 10 | 43 | 37 | 30 | 37 |