Multi-modal Representation Learning on MMEB OOD 1.0
59.1OOD Precision@1MegaPairs
Evaluation Results
| Method | Links | |
|---|---|---|
| MegaPairsEvaluation Protocol=Fine-tuning, Model Backbone=LLaVA-1.62026.02 | 59.1 | |
| SDEEvaluation Protocol=Fine-tuning, Model Backbone=LLaVA-1.6, Resolution=1344x1344 (HR)2026.02 | 58.1 | |
| UniMEEvaluation Protocol=Fine-tuning, Model Backbone=LLaVA-1.62026.02 | 57.9 | |
| VLM2VecEvaluation Protocol=Fine-tuning, Model Backbone=LLaVA-1.6, Resolution=1344x1344 (HR)2026.02 | 57.1 | |
| UniMEEvaluation Protocol=Fine-tuning, Model Backbone=Phi3.5-V2026.02 | 52.7 | |
| SDEEvaluation Protocol=Fine-tuning, Model Backbone=Qwen2-VL-2B2026.02 | 52.7 | |
| VLM2VecEvaluation Protocol=Fine-tuning, Model Backbone=Qwen2-VL-2B2026.02 | 52.6 | |
| VLM2VecEvaluation Protocol=Fine-tuning, Model Backbone=Phi3.5-V2026.02 | 52 | |
| SDEEvaluation Protocol=Fine-tuning, Model Backbone=Phi3.5-V2026.02 | 51.6 | |
| SDEEvaluation Protocol=Fine-tuning, Model Backbone=LLaVA-1.6, Resolution=336x336 (LR)2026.02 | 49.8 | |
| VLM2VecEvaluation Protocol=Fine-tuning, Model Backbone=LLaVA-1.6, Resolution=336x336 (LR)2026.02 | 47.5 | |
| OpenCLIP-FFTEvaluation Protocol=Fine-tuning2026.02 | 43.1 | |
| CLIP-FFTEvaluation Protocol=Fine-tuning2026.02 | 42.8 | |
| UniIREvaluation Protocol=Zero-shot, Fusion Strategy=score-level, Backbone=CLIP2026.02 | 41.7 | |
| UniIREvaluation Protocol=Zero-shot, Fusion Strategy=feature-level, Backbone=BLIP2026.02 | 40.4 | |
| CLIPEvaluation Protocol=Zero-shot2026.02 | 38.7 | |
| BLIP2Evaluation Protocol=Zero-shot2026.02 | 25.1 | |
| MagiclensEvaluation Protocol=Zero-shot2026.02 | 23.7 |