Multimodal Retrieval on RAVENEA (test)
82.17MRRRavenea-CLIP
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Ravenea-CLIPEvaluation protocol=Fine-tuned, Backbone Architecture=CLIP-L/14, Resolution=224px, Training Data=RAVENEA2025.05 | 82.17 | 72.05 | 45.76 | 36.77 | 77.08 | 78.96 | 84.09 | |
| CLIP-L/14@224pxEvaluation protocol=Frozen, Backbone Architecture=CLIP-L/14, Resolution=224px2025.05 | 75.44 | 60.87 | 41.41 | 34.41 | 67.75 | 72.31 | 78.09 | |
| Ravenea-SigLIPEvaluation protocol=Fine-tuned, Backbone Architecture=SigLIP2-SO/14, Resolution=384px, Training Data=RAVENEA2025.05 | 70.95 | 57.14 | 40.99 | 33.29 | 63.86 | 68.31 | 73.92 | |
| SigLIP2-SO/14@384pxEvaluation protocol=Frozen, Backbone Architecture=SigLIP2-SO/14, Resolution=384px2025.05 | 68.62 | 54.66 | 37.47 | 32.92 | 61.22 | 63.82 | 71.44 | |
| VisualBERTEvaluation protocol=Frozen2025.05 | 61.33 | 46.71 | 33.14 | 29.42 | 55.76 | 59.42 | 65.92 | |
| LLaVA-OV-7BEvaluation protocol=Frozen, Model Scale=7B2025.05 | 58.85 | 37.48 | 30.68 | 28.21 | 48.59 | 51.8 | 60.34 | |
| VL-T5Evaluation protocol=Frozen2025.05 | 58.33 | 39.86 | 32.58 | 29.35 | 47.74 | 57.29 | 62.12 |