Multimodal Retrieval on MMEB
788.1Classification ScoreUniME-V2
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| UniME-V2Backbone (Model Size)=LLaVA-OV (8.0B)2026.02 | 788.1 | 906.9 | — | — | — | — | — | 7,371 | 7,371 | |
| VLM2VecBackbone (Model Size)=LLaVA-1.6 (8.4B)2026.02 | 278.9 | 332.3 | — | — | — | — | — | 2,928 | 2,928 | |
| LLaVEBackbone (Model Size)=Aquila-VL (2.0B)2026.02 | 143 | 162.8 | — | — | — | — | — | 3,699 | 3,699 | |
| VLM2VecBackbone (Model Size)=Phi3.5-V (4.2B)2026.02 | 85.9 | 99.4 | — | — | — | — | — | 757 | 757 | |
| FreeRetMLLM=Qwen2.5-VL-7B, rn=r502025.09 | 69.4 | 70 | 69.9 | 78.2 | — | — | 70.7 | — | — | |
| UNITEBackbone=Qwen2-VL, #Params=7B2026.02 | 68.3 | 65.1 | 71.6 | 84.8 | 73.6 | 66.3 | 70.3 | — | — | |
| CREMBackbone=Qwen2-VL, #Params=7B2026.02 | 68.3 | 69.4 | 72.9 | 86.1 | 75.6 | 67.8 | 72.1 | — | — | |
| UNITEMLLM=Qwen2-VL-7B, Train Data (M)=7.9, Embedding-only=true2025.09 | 68.3 | 65.1 | 71.6 | 84.8 | — | — | 70.3 | — | — | |
| FreeRetMLLM=Qwen2.5-VL-7B, rn=r52025.09 | 68.3 | 64.6 | 63.1 | 69.9 | — | — | 65.7 | — | — | |
| mmE5Backbone=Llama-3.2-Vision, #Params=11B2026.02 | 67.6 | 62.8 | 70.9 | 89.7 | 72.3 | 66.7 | 69.8 | — | — | |
| mmE5MLLM=Llama-3.2-11B-Vision, Train Data (M)=1.2, Embedding-only=true2025.09 | 67.6 | 62.6 | 71 | 89.6 | — | — | 69.8 | — | — | |
| SSA-MEEvaluation Protocol=Trained on MMEB, Model Scale=>= 7B, Backbone=Qwen2VL-7B2026.04 | 67.4 | 61.5 | 72.4 | 81.3 | 73.5 | 63.3 | 69 | — | — | |
| FreeRetMLLM=Qwen2.5-VL-7B, rn=r102025.09 | 67.2 | 67.6 | 66.3 | 74.3 | — | — | 67.8 | — | — | |
| UniMEBackbone=LLaVA-OV, Model Size=8.0B, Training Protocol=Trained with MMEB2026.02 | 66.8 | 66.6 | 70.5 | 90.9 | 74.6 | 65.8 | 70.7 | — | — | |
| QQMMBackbone=LLaVA-OV, Model Size=8.0B, Training Protocol=Trained with MMEB2026.02 | 66.8 | 66.8 | 70.5 | 90.4 | 74.7 | 65.6 | 70.7 | — | — | |
| UniMEBackbone=LLaVA-OV, #Params=7B2026.02 | 66.8 | 66.6 | 70.5 | 90.9 | — | — | 70.7 | — | — | |
| UniMEMLLM=LLaVA-OV-7B, Train Data (M)=0.9, Embedding-only=true2025.09 | 66.8 | 66.6 | 70.6 | 90.9 | — | — | 70.7 | — | — | |
| IDMRMLLM=InternVL2.5-26B, Train Data (M)=1.2, Embedding-only=true2025.09 | 66.3 | 61.9 | 71.1 | 88.6 | — | — | 69.2 | — | — | |
| CREMBackbone=Qwen2-VL, #Params=2B2026.02 | 65.8 | 60.7 | 68.3 | 78.9 | 70.8 | 61.5 | 66.7 | — | — | |
| LLaVEBackbone=LLaVA-OV, Model Size=8.0B, Training Protocol=Trained with MMEB2026.02 | 65.7 | 65.4 | 70.9 | 91.9 | 75 | 64.4 | 70.3 | — | — | |
| SSA-MEEvaluation Protocol=Trained on MMEB, Model Scale=<= 2B, Backbone=Qwen2VL-2B2026.04 | 65.7 | 58.2 | 68.9 | 77.5 | 70.9 | 59.8 | 66 | — | — | |
| LLaVEMLLM=LLaVA-OV-7B, Train Data (M)=0.7, Embedding-only=true2025.09 | 65.7 | 65.4 | 70.9 | 91.9 | — | — | 70.3 | — | — | |
| UniME-V2Backbone=LLaVA-OV, Model Size=8.0B, Training Protocol=Trained with MMEB2026.02 | 65.3 | 67.6 | 72.9 | 90.2 | 74.8 | 66.7 | 71.2 | — | — | |
| CAFeBackbone=LLaVA-OV, #Params=7B2026.02 | 65.2 | 65.6 | 70 | 91.2 | 75.8 | 62.4 | 69.8 | — | — | |
| CAFeMLLM=LLaVA-OV-7B, Train Data (M)=0.9, Embedding-only=true2025.09 | 65.2 | 65.6 | 70 | 91.2 | — | — | 69.8 | — | — | |
| Magic-MM-Embedding (E)Backbone=InternVL3-VTC, Model Size=8.1B, Training Protocol=Trained with MMEB, Retrieval Mode=Single-stage (E)2026.02 | 64.8 | 68.1 | 75 | 88.7 | 78.3 | 63.6 | 71.8 | — | — | |
| Magic-MM-Embedding (E+R)Backbone=InternVL3-VTC, Model Size=8.1B, Training Protocol=Trained with MMEB, Retrieval Mode=Two-stage (E+R)2026.02 | 64.3 | 70.9 | 75.7 | 90.4 | 78.4 | 65.9 | 72.8 | — | — | |
| UniME-V2 (E+R)Backbone=Qwen2VL, Model Size=2.2B, Training Protocol=Trained with MMEB, Retrieval Mode=Two-stage (E+R)2026.02 | 64.1 | 64.3 | 71.6 | 70.6 | 69.8 | 64.3 | 67.4 | — | — | |
| UniME-V2 (E)Backbone=Qwen2VL, Model Size=8.3B, Training Protocol=Trained with MMEB, Retrieval Mode=Single-stage (E)2026.02 | 64 | 60.1 | 73.1 | 82.8 | 72 | 63 | 68 | — | — | |
| UniME-V2 (E+R)Backbone=Qwen2VL, Model Size=8.3B, Training Protocol=Trained with MMEB, Retrieval Mode=Two-stage (E+R)2026.02 | 63.8 | 66.3 | 73.5 | 75 | 71.7 | 65.6 | 69 | — | — | |
| UNITEBackbone=Qwen2-VL, #Params=2B2026.02 | 63.2 | 55.9 | 65.4 | 75.6 | 65.8 | 60.1 | 63.3 | — | — | |
| UNITEinstructEvaluation Protocol=Trained on MMEB, Model Scale=<= 2B2026.04 | 63.2 | 55.9 | 65.4 | 75.6 | 65.8 | 60.1 | 63.3 | — | — | |
| VLM2Vec-V2Backbone=Qwen2-VL, #Params=2B2026.02 | 62.9 | 56.3 | 69.5 | 77.3 | 68.7 | 60.1 | 64.9 | — | — | |
| VLM2Vec-V1Backbone=Qwen2VL, Model Size=8.3B, Training Protocol=Trained with MMEB2026.02 | 62.6 | 57.8 | 69.9 | 81.7 | 65.2 | 56.3 | 65.8 | — | — | |
| VLM2VecBackbone=Qwen2-VL, #Params=7B2026.02 | 62.6 | 57.8 | 69.9 | 81.7 | 72.2 | 57.8 | 65.8 | — | — | |
| VLM2Vec (Qwen2VL-7B)Evaluation Protocol=Trained on MMEB, Model Scale=>= 7B, Backbone=Qwen2VL-7B2026.04 | 62.6 | 57.8 | 69.9 | 81.7 | 72.2 | 57.8 | 65.8 | — | — | |
| LLaVEBackbone=Aquila-VL, Model Size=2.0B, Training Protocol=Trained with MMEB2026.02 | 62.1 | 60.2 | 65.2 | 84.9 | 69.4 | 59.8 | 65.2 | — | — | |
| UniME-V2 (E)Backbone=Qwen2VL, Model Size=2.2B, Training Protocol=Trained with MMEB, Retrieval Mode=Single-stage (E)2026.02 | 62.1 | 56.3 | 68 | 72.7 | 67.4 | 58.9 | 63.6 | — | — | |
| LLaVEBackbone=Aquila-VL, #Params=2B2026.02 | 62.1 | 60.2 | 65.2 | 84.9 | 69.4 | 59.8 | 65.2 | — | — | |
| LLaVE (Aquila-VL-2B)Evaluation Protocol=Trained on MMEB, Model Scale=<= 2B, Backbone=Aquila-VL-2B2026.04 | 62.1 | 60.2 | 65.2 | 84.9 | 69.4 | 59.8 | 65.2 | — | — | |
| LamRABackbone (Model Size)=Qwen2.5VL (8.3B)2026.02 | 61.6 | 83.4 | — | — | — | — | — | 362.8 | 256 | |
| Magic-MM-Embedding (E+R)Backbone=InternVL3-VTC, Model Size=1.9B, Training Protocol=Trained with MMEB, Retrieval Mode=Two-stage (E+R)2026.02 | 61.3 | 67.2 | 73.5 | 89.8 | 75.2 | 63.9 | 70.2 | — | — | |
| VLM2Vec (LLaVA-1.6-7B)Evaluation Protocol=Trained on MMEB, Model Scale=>= 7B, Backbone=LLaVA-1.6-7B2026.04 | 61.2 | 49.9 | 67.4 | 86.1 | 67.5 | 57.1 | 62.9 | — | — | |
| VLM2VecMLLM=LLaVA-1.6-7B, Train Data (M)=0.7, Embedding-only=true2025.09 | 61.2 | 49.9 | 67.4 | 86.1 | — | — | 62.9 | — | — | |
| Magic-MM-Embedding (E)Backbone=InternVL3-VTC, Model Size=1.9B, Training Protocol=Trained with MMEB, Retrieval Mode=Single-stage (E)2026.02 | 60.9 | 63.3 | 72.2 | 84.6 | 74.7 | 59.5 | 68 | — | — | |
| UniME (LLaVA-1.6-7B)Evaluation Protocol=Trained on MMEB, Model Scale=>= 7B, Backbone=LLaVA-1.6-7B2026.04 | 60.6 | 52.9 | 67.9 | 85.1 | 68.4 | 57.9 | 66.6 | — | — | |
| FreeRet-embedMLLM=Qwen2.5-VL-7B, Embedding-only=true2025.09 | 59.7 | 52.8 | 49.2 | 54.7 | — | — | 53.7 | — | — | |
| CAFeBackbone=LLaVA-OV, #Params=1B2026.02 | 59.1 | 49.1 | 61 | 83 | 64.3 | 53.7 | 59.6 | — | — | |
| VLM2Vec-V1Backbone=Qwen2VL, Model Size=2.2B, Training Protocol=Trained with MMEB2026.02 | 59 | 49.4 | 65.4 | 73.4 | 66 | 52.6 | 59.3 | — | — | |
| VLM2VecBackbone=Qwen2-VL, #Params=2B2026.02 | 59 | 49.4 | 65.4 | 73.4 | 66 | 52.6 | 59.3 | — | — | |
| VLM2Vec (Qwen2VL-2B)Evaluation Protocol=Trained on MMEB, Model Scale=<= 2B, Backbone=Qwen2VL-2B2026.04 | 59 | 49.4 | 65.4 | 73.4 | 66 | 52.6 | 60.1 | — | — | |
| FreeRet-embedMLLM=Qwen2-VL-7B, Embedding-only=true2025.09 | 59 | 50.2 | 52.3 | 60.1 | — | — | 54.5 | — | — | |
| GMEMLLM=Qwen2-VL-7B, Train Data (M)=8.0, Embedding-only=true2025.09 | 57.7 | 34.7 | 71.2 | 59.3 | — | — | 56 | — | — | |
| GMEBackbone (Model Size)=Qwen2VL (8.3B)2026.02 | 56.7 | 82.2 | — | — | — | — | — | 362.8 | 256 | |
| EVA-CLIPBackbone=N/A, Model Size=8.1B, Training Protocol=Zero-shot2026.02 | 56 | 10.4 | 49.2 | 58.9 | 38.1 | 45.6 | 43.7 | — | — | |
| OpenCLIPBackbone=-, #Params=0.4B2026.02 | 56 | 21.9 | 55.4 | 64.1 | 50.5 | 43.1 | 47.2 | — | — | |
| MMRetBackbone=LLaVA-1.6, #Params=7B2026.02 | 56 | 57.4 | 69.9 | 83.6 | 68 | 59.1 | 65.8 | — | — | |
| OpenCLIPEvaluation Protocol=Trained on MMEB, Model Scale=<= 2B2026.04 | 56 | 21.9 | 55.4 | 64.1 | 50.5 | 43.1 | 47.2 | — | — | |
| MMRet (LLaVA-Next-7B)Evaluation Protocol=Trained on MMEB, Model Scale=>= 7B, Backbone=LLaVA-Next-7B2026.04 | 56 | 59.4 | 69.9 | 83.6 | 68 | 59.1 | 64.1 | — | — | |
| MMRetMLLM=LLaVA-1.6-7B, Train Data (M)=26.9, Embedding-only=true2025.09 | 56 | 57.4 | 69.9 | 83.6 | — | — | 64.1 | — | — | |
| InternVL3Backbone (Model Size)=InternVL3 (8.1B)2026.02 | 55.9 | 76.7 | — | — | — | — | — | 398.4 | 256 | |
| LamRAMLLM=Qwen2.5-VL-7B, Train Data (M)=1.4 + 1.1‡, rn=r102025.09 | 55.9 | 40.4 | 66.1 | 55.6 | — | — | 55 | — | — | |
| CLIPBackbone=-, #Params=0.4B2026.02 | 55.2 | 19.7 | 53.2 | 62.2 | 47.6 | 42.8 | 45.4 | — | — | |
| CLIPEvaluation Protocol=Trained on MMEB, Model Scale=<= 2B2026.04 | 55.2 | 19.7 | 53.2 | 62.2 | 47.6 | 42.8 | 45.4 | — | — | |
| UniMEBackbone=Phi3.5-V, Model Size=4.2B, Training Protocol=Trained with MMEB2026.02 | 54.8 | 55.9 | 64.5 | 81.8 | 68.2 | 52.7 | 64.2 | — | — | |
| VLM2Vec (Phi-3.5-V)Evaluation Protocol=Trained on MMEB, Model Scale=<= 2B, Backbone=Phi-3.5-V2026.04 | 54.8 | 54.9 | 62.3 | 79.5 | 66.5 | 52 | 60.1 | — | — | |
| UniME (Phi-3.5-V)Evaluation Protocol=Trained on MMEB, Model Scale=<= 2B, Backbone=Phi-3.5-V2026.04 | 54.8 | 55.9 | 64.5 | 81.8 | 68.2 | 52.7 | 64.2 | — | — | |
| GMEBackbone=Qwen2-VL, #Params=2B2026.02 | 54.4 | 29.9 | 66.9 | 55.5 | — | — | 51.9 | — | — | |
| FreeRet-embedMLLM=LLaVA-OV-7B, Embedding-only=true2025.09 | 53 | 47.4 | 45.7 | 53.6 | — | — | 49.1 | — | — | |
| LamRA-RetMLLM=Qwen2.5-VL-7B, Train Data (M)=1.4, Embedding-only=true2025.09 | 51.7 | 34.1 | 66.9 | 56.7 | — | — | 52.4 | — | — | |
| MM-EmbedMLLM=LLaVA-Next-7B, Train Data (M)=1.1, Embedding-only=true2025.09 | 48.1 | 32.3 | 63.8 | 57.8 | — | — | 50 | — | — | |
| OpenCLIPEvaluation Protocol=Zero-shot2026.04 | 47.8 | 10.9 | 52.3 | 53.3 | 39.3 | 40.2 | 39.7 | — | — | |
| MMRetMLLM=LLaVA-1.6-7B, Train Data (M)=26.2, Embedding-only=true2025.09 | 47.2 | 18.4 | 56.5 | 62.2 | — | — | 44 | — | — | |
| MM-EmbedMLLM=LLaVA-Next-7B, Train Data (M)=1.1 + 0‡, rn=r102025.09 | 46.5 | 60.8 | 57.8 | 52.3 | — | — | 54.9 | — | — | |
| UniIR (CLIP_SF)Evaluation Protocol=Zero-shot2026.04 | 44.3 | 16.2 | 61.8 | 65.3 | 47.1 | 41.7 | 44.7 | — | — | |
| UniMEMLLM=LLaVA-1.6-7B, Train Data (M)=0.3, Embedding-only=true2025.09 | 43 | 17.7 | 42.5 | 63.2 | — | — | 41.6 | — | — | |
| CLIPBackbone=N/A, Model Size=0.4B, Training Protocol=Zero-shot2026.02 | 42.8 | 9.1 | 53 | 51.8 | 37.1 | 38.7 | 37.8 | — | — | |
| CLIPEvaluation Protocol=Zero-shot2026.04 | 42.8 | 9.1 | 53 | 51.8 | 37.1 | 38.7 | 37.8 | — | — | |
| UniIR (BLIP_FF)Evaluation Protocol=Zero-shot2026.04 | 42.1 | 15 | 60.1 | 62.2 | 44.7 | 40.4 | 42.8 | — | — | |
| E5-VMLLM=Qwen2.5-VL-7B, Note=reproduction of training-free version, Embedding-only=true2025.09 | 41.2 | 37.2 | 37.9 | 48.4 | — | — | 39.8 | — | — | |
| Magic-MM-EmbeddingBackbone (Model Size)=InternVL3-VTC (8.1B)2026.02 | 40.6 | 50.9 | — | — | — | — | — | 99.6 | 64 | |
| SigLIPBackbone=N/A, Model Size=0.9B, Training Protocol=Zero-shot2026.02 | 40.3 | 8.4 | 31.6 | 59.5 | 32.3 | 38 | 34.8 | — | — | |
| SigLIPEvaluation Protocol=Zero-shot2026.04 | 40.3 | 8.4 | 31.6 | 59.5 | 32.3 | 38 | 34.8 | — | — | |
| E5-VBackbone=LLaVA-1.6, Model Size=8.4B, Training Protocol=Zero-shot2026.02 | 39.7 | 10.8 | 39.4 | 60.2 | 34.2 | 33.4 | 37.5 | — | — | |
| E5-VBackbone=LLaVA-1.6, #Params=7B2026.02 | 39.7 | 10.8 | 39.4 | 60.2 | 34.2 | 33.9 | 33.9 | — | — | |
| E5-VEvaluation Protocol=Trained on MMEB, Model Scale=>= 7B2026.04 | 39.7 | 10.8 | 39.4 | 60.2 | 34.2 | 33.4 | 33.9 | — | — | |
| E5-VBackbone=Phi3.5-V, Model Size=4.2B, Training Protocol=Zero-shot2026.02 | 39.1 | 9.6 | 38 | 57.6 | 33.1 | 31.9 | 36.1 | — | — | |
| MagicLensBackbone=N/A, Model Size=0.4B, Training Protocol=Zero-shot2026.02 | 38.8 | 8.3 | 35.4 | 26 | 31 | 23.7 | 27.8 | — | — | |
| MagiclensEvaluation Protocol=Zero-shot2026.04 | 38.8 | 8.3 | 35.4 | 26 | 31 | 23.7 | 27.8 | — | — | |
| GMEBackbone (Model Size)=Qwen2VL (2.2B)2026.02 | 34.5 | 46.8 | — | — | — | — | — | 362.8 | 256 | |
| InternVL3Backbone (Model Size)=InternVL3 (1.9B)2026.02 | 29.2 | 37.1 | — | — | — | — | — | 398.4 | 256 | |
| BLIP2Evaluation Protocol=Zero-shot2026.04 | 27 | 4.2 | 33.9 | 47 | 25.3 | 25.1 | 25.2 | — | — | |
| Magic-MM-EmbeddingBackbone (Model Size)=InternVL3-VTC (1.9B)2026.02 | 26.1 | 29.9 | — | — | — | — | — | 99.6 | 64 | |
| E5-VEvaluation Protocol=Zero-shot2026.04 | 21.8 | 4.9 | 11.5 | 19 | 14.9 | 11.5 | 13.3 | — | — | |
| UniME-V2MLLM=Qwen2.5-VL-7B, Train Data (M)=0.6 + 0.6‡, rn=r52025.09 | — | — | — | — | — | — | 69.6 | — | — |