Multimodal Model Evaluation on MME (Score)
1,636.5MME ScoreClean
Evaluation Results
| Method | Links | |
|---|---|---|
| CleanModel=Qwen2.5-VL, Vision Encoder=Qwen-ViT2024.12 | 1,636.5 | |
| CleanModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | 1,521.2 | |
| Img-EmbModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | 1,367.5 | |
| Both-EmbModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | 1,289.1 | |
| CleanModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | 1,236.7 | |
| Text-EmbModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | 1,217.7 | |
| Both-EmbModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | 1,115.9 | |
| Img-EmbModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | 1,109.1 | |
| Img-EmbModel=Qwen2.5-VL, Vision Encoder=Qwen-ViT2024.12 | 923.2 | |
| Text-EmbModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | 849.7 | |
| VEV-UAPModel=Qwen2.5-VL, Vision Encoder=Qwen-ViT2024.12 | 758.2 | |
| VEV-UAPModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | 754.5 | |
| CleanModel=LLaVA, Vision Encoder=CLIP-3362024.12 | 747.8 | |
| Both-EmbModel=LLaVA, Vision Encoder=CLIP-3362024.12 | 699 | |
| Text-EmbModel=LLaVA, Vision Encoder=CLIP-3362024.12 | 635.9 | |
| Img-EmbModel=LLaVA, Vision Encoder=CLIP-3362024.12 | 621.5 | |
| VEV-UAPModel=LLaVA, Vision Encoder=CLIP-3362024.12 | 23.6 | |
| VEV-UAPModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | 10.8 |