Multi-modal Representation Learning on MMEB In-Distribution 1.0
71.6MMEB IND Precision@1SDE
Evaluation Results
| Method | Links | |
|---|---|---|
| SDEEvaluation Protocol=Fine-tuning, Model Backbone=LLaVA-1.6, Resolution=1344x1344 (HR)2026.02 | 71.6 | |
| SDEEvaluation Protocol=Fine-tuning, Model Backbone=Phi3.5-V2026.02 | 69.8 | |
| UniMEEvaluation Protocol=Fine-tuning, Model Backbone=LLaVA-1.62026.02 | 68.4 | |
| UniMEEvaluation Protocol=Fine-tuning, Model Backbone=Phi3.5-V2026.02 | 68.2 | |
| MegaPairsEvaluation Protocol=Fine-tuning, Model Backbone=LLaVA-1.62026.02 | 68 | |
| VLM2VecEvaluation Protocol=Fine-tuning, Model Backbone=LLaVA-1.6, Resolution=1344x1344 (HR)2026.02 | 67.5 | |
| SDEEvaluation Protocol=Fine-tuning, Model Backbone=Qwen2-VL-2B2026.02 | 66.9 | |
| VLM2VecEvaluation Protocol=Fine-tuning, Model Backbone=Phi3.5-V2026.02 | 66.5 | |
| SDEEvaluation Protocol=Fine-tuning, Model Backbone=LLaVA-1.6, Resolution=336x336 (LR)2026.02 | 66.3 | |
| VLM2VecEvaluation Protocol=Fine-tuning, Model Backbone=Qwen2-VL-2B2026.02 | 66 | |
| VLM2VecEvaluation Protocol=Fine-tuning, Model Backbone=LLaVA-1.6, Resolution=336x336 (LR)2026.02 | 61 | |
| OpenCLIP-FFTEvaluation Protocol=Fine-tuning2026.02 | 50.5 | |
| CLIP-FFTEvaluation Protocol=Fine-tuning2026.02 | 47.6 | |
| UniIREvaluation Protocol=Zero-shot, Fusion Strategy=score-level, Backbone=CLIP2026.02 | 47.1 | |
| UniIREvaluation Protocol=Zero-shot, Fusion Strategy=feature-level, Backbone=BLIP2026.02 | 44.7 | |
| CLIPEvaluation Protocol=Zero-shot2026.02 | 37.1 | |
| MagiclensEvaluation Protocol=Zero-shot2026.02 | 31 | |
| BLIP2Evaluation Protocol=Zero-shot2026.02 | 25.3 |