Multi-modal Embedding on MMEB 1.0 (test)
67.6Classification AccuracymmE5
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| mmE5Size=11B, Training Paradigm=Only contrastive learning2026.03 | 67.6 | 62.7 | 71 | 89.7 | 72.4 | 66.6 | 69.8 | |
| MoCaSize=7B, Training Paradigm=Pretrain before contrastive learning, Backbone=Qwen2.5-VL2026.03 | 65.8 | 64.7 | 75 | 92.4 | 74.7 | 67.6 | 71.5 | |
| LLaVE-7BModel Scale (Parameters)=7B2025.03 | 65.7 | 65.4 | 70.9 | 91.9 | 75 | 64.4 | 70.3 | |
| VIRTUE-7BFinetuning on MMEB-Train=Yes2025.10 | 65.6 | 60.4 | 71.8 | 87.3 | 74.4 | 61.4 | 68.6 | |
| CoCoASize=7B, Training Paradigm=Our method, Backbone=Qwen2.5-VL2026.03 | 64.7 | 66.5 | 72.5 | 90.1 | 75.7 | 64.3 | 70.6 | |
| VIRTUE-2BFinetuning on MMEB-Train=Yes2025.10 | 64.1 | 55.7 | 68.4 | 78.7 | 69.7 | 58.8 | 64.8 | |
| VLM2Vec (LLaVA-OV-7B)Model Scale (Parameters)=7B2025.03 | 63.5 | 61.1 | 64.5 | 87.3 | 69.7 | 61 | 65.8 | |
| UNITESize=2B, Training Paradigm=Only contrastive learning, Backbone=Qwen2-VL2026.03 | 63.2 | 55.9 | 65.4 | 75.6 | 65.8 | 60.1 | 63.3 | |
| CoCoASize=2B, Training Paradigm=Our method, Backbone=Qwen2-VL2026.03 | 63 | 57.4 | 69.6 | 85.8 | 70.2 | 60.7 | 66 | |
| VLM2Vec-7BFinetuning on MMEB-Train=Yes2025.10 | 62.7 | 56.9 | 69.4 | 82.2 | 71.4 | 58.1 | 65.5 | |
| VLM2VecSize=7B, Training Paradigm=Only contrastive learning, Backbone=Qwen2-VL2026.03 | 62.6 | 57.8 | 69.9 | 81.7 | 72.2 | 57.8 | 65.8 | |
| LLaVE-2BModel Scale (Parameters)=2B2025.03 | 62.1 | 60.2 | 65.2 | 84.9 | 69.4 | 59.8 | 65.2 | |
| VLM2Vec (LLaVA-NeXT-7B-HR)Model Scale (Parameters)=7B, Input Resolution=high-resolution (1344×1344)2025.03 | 61.2 | 49.9 | 67.4 | 86.1 | 67.5 | 57.1 | 62.9 | |
| VLM2Vec (Aquila-VL-2B)Model Scale (Parameters)=2B2025.03 | 61.1 | 57.3 | 62.1 | 85.5 | 67.2 | 58.1 | 63.1 | |
| CoCoASize=3B, Training Paradigm=Our method, Backbone=Qwen2.5-VL2026.03 | 60.9 | 63.5 | 69.5 | 88.2 | 72.6 | 61.2 | 67.5 | |
| UniME-7BFinetuning on MMEB-Train=Yes2025.10 | 60.6 | 52.9 | 67.9 | 85.1 | 68.4 | 57.9 | 66.6 | |
| UniMESize=7B, Training Paradigm=Pretrain before contrastive learning, Backbone=LLaVA-1.62026.03 | 60.6 | 52.9 | 67.9 | 85.1 | 68.4 | 57.9 | 66.6 | |
| MoCaSize=3B, Training Paradigm=Pretrain before contrastive learning, Backbone=Qwen2.5-VL2026.03 | 59.8 | 62.9 | 70.6 | 88.6 | 72.3 | 61.5 | 67.5 | |
| LamRA-7BFinetuning on MMEB-Train=No2025.10 | 59.2 | 26.5 | 70 | 62.7 | 53 | 55.4 | 54.1 | |
| VLM2VecSize=2B, Training Paradigm=Only contrastive learning, Backbone=Qwen2-VL2026.03 | 59 | 49.4 | 65.4 | 73.4 | 66 | 52.6 | 59.3 | |
| VLM2Vec-2BFinetuning on MMEB-Train=Yes2025.10 | 58.7 | 49.3 | 65 | 72.9 | 64.9 | 53.3 | 59.7 | |
| GME-7BFinetuning on MMEB-Train=No2025.10 | 57.7 | 34.7 | 71.2 | 59.3 | 53.6 | 58.8 | 56 | |
| LLaVE-0.5BModel Scale (Parameters)=0.5B2025.03 | 57.4 | 50.3 | 59.8 | 82.9 | 64.7 | 52 | 59.1 | |
| GMESize=2B, Training Paradigm=Only contrastive learning, Backbone=Qwen2-VL2026.03 | 56.9 | 41.2 | 67.8 | 53.4 | — | — | 55.8 | |
| OpenCLIP L/14Finetuning on MMEB-Train=Yes2025.10 | 56 | 21.9 | 55.4 | 64.1 | 50.5 | 43.1 | 47.2 | |
| MMRet-7BFinetuning on MMEB-Train=Yes2025.10 | 56 | 57.4 | 69.9 | 83.6 | 68 | 59.1 | 64.1 | |
| MMRet (LLaVA-NeXT-7B)Model Scale (Parameters)=7B2025.03 | 56 | 57.4 | 69.9 | 83.6 | 68 | 59.1 | 64.1 | |
| OpenCLIPSize=428M, Training Paradigm=Only contrastive learning, Backbone=ViT-L2026.03 | 56 | 21.9 | 55.4 | 64.1 | 50.5 | 43.1 | 47.2 | |
| VLM2VecSize=3B, Training Paradigm=Only contrastive learning, Backbone=Qwen2.5-VL2026.03 | 55.3 | 57.3 | 62.7 | 73.2 | — | — | 60.3 | |
| CLIP L/14Finetuning on MMEB-Train=Yes2025.10 | 55.2 | 19.7 | 53.2 | 62.2 | 47.6 | 42.8 | 45.4 | |
| CLIPSize=428M, Training Paradigm=Only contrastive learning, Backbone=ViT-L2026.03 | 55.2 | 19.7 | 53.2 | 62.2 | 47.6 | 42.8 | 45.4 | |
| VLM2Vec (Phi-3.5-V-4B)Model Scale (Parameters)=4B2025.03 | 54.8 | 54.9 | 62.3 | 79.5 | 66.5 | 52 | 60.1 | |
| UniMESize=4.2B, Training Paradigm=Pretrain before contrastive learning, Backbone=Phi3.5-V2026.03 | 54.8 | 55.9 | 64.5 | 81.8 | 68.2 | 52.7 | 64.2 | |
| VLM2Vec (LLaVA-NeXT-7B-LR)Model Scale (Parameters)=7B, Input Resolution=low-resolution (336×336)2025.03 | 54.7 | 50.3 | 56.2 | 64 | 61 | 47.5 | 55 | |
| VLM2Vec (LLaVA-OV-0.5B)Model Scale (Parameters)=0.5B2025.03 | 54.6 | 44.7 | 56.8 | 76.5 | 59.8 | 49.1 | 55 | |
| GME-2BFinetuning on MMEB-Train=No2025.10 | 54.4 | 29.9 | 66.9 | 55.5 | 49.2 | 55.2 | 51.9 | |
| OpenCLIP L/14Finetuning on MMEB-Train=No2025.10 | 47.8 | 10.9 | 52.3 | 53.3 | 39.3 | 40.2 | 39.7 | |
| OpenCLIP2025.03 | 47.8 | 10.9 | 52.3 | 53.3 | 39.3 | 40.2 | 39.7 | |
| UniIR CLIP CFFinetuning on MMEB-Train=No2025.10 | 44.3 | 16.2 | 61.8 | 65.3 | 47.1 | 41.7 | 44.7 | |
| UniIR (CLIP_SF)Fusion Strategy=score-level fusion (SF)2025.03 | 44.3 | 16.2 | 61.8 | 65.3 | 47.1 | 41.7 | 44.7 | |
| CLIP L/14Finetuning on MMEB-Train=No2025.10 | 42.8 | 9.1 | 53 | 51.8 | 37.1 | 38.7 | 37.8 | |
| CLIP2025.03 | 42.8 | 9.1 | 53 | 51.8 | 37.1 | 38.7 | 37.8 | |
| UniIR (BLIP_FF)Fusion Strategy=feature-level fusion (FF)2025.03 | 42.1 | 15 | 60.1 | 62.2 | 44.7 | 40.4 | 42.8 | |
| SigLIP so400m-14-384Finetuning on MMEB-Train=No2025.10 | 40.3 | 8.4 | 31.6 | 59.5 | 32.3 | 38 | 34.8 | |
| SigLIP2025.03 | 40.3 | 8.4 | 31.6 | 59.5 | 32.3 | 38 | 34.8 | |
| E5-VSize=7B, Training Paradigm=Only contrastive learning, Backbone=LLaVA-1.62026.03 | 39.7 | 10.8 | 39.4 | 60.2 | 34.2 | 33.9 | 33.9 | |
| Magiclens CLIP-LFinetuning on MMEB-Train=No2025.10 | 38.8 | 8.3 | 35.4 | 26 | 31 | 23.7 | 27.8 | |
| Magiclens2025.03 | 38.8 | 8.3 | 35.4 | 26 | 31 | 23.7 | 27.8 | |
| BLIP2 opt-2.7bFinetuning on MMEB-Train=No2025.10 | 27 | 4.2 | 33.9 | 47 | 25.3 | 25.1 | 25.2 | |
| BLIP22025.03 | 27 | 4.2 | 33.9 | 47 | 25.3 | 25.1 | 25.2 | |
| E5-V-8BFinetuning on MMEB-Train=No2025.10 | 21.8 | 4.9 | 11.5 | 19 | 14.9 | 11.5 | 13.3 | |
| E5-V2025.03 | 21.8 | 4.9 | 11.5 | 19 | 14.9 | 11.5 | 13.3 |