Multi-modal Understanding on MMBench EN
86.3Overall ScoreGemini-2.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-ProDate=2024.12, Tokenization Paradigm=Proprietary Models2026.02 | 86.3 | |
| VQ-RAEModel Scale=7B, Date=2025.11, Tokenization Paradigm=Hybrid Tokenization2026.02 | 85.1 | |
| BagelModel Scale=14B, Date=2025.05, Tokenization Paradigm=Continuous Tokenization2026.02 | 85 | |
| Bagel#LLM=14B2025.12 | 85 | |
| STAR-7B#LLM=7B2025.12 | 83.9 | |
| BLIP3-o#LLM=8B2025.12 | 83.5 | |
| MetaQuery-XL#LLM=7B2025.12 | 83.5 | |
| VanillaMode=Upper bound2024.12 | 83.5 | |
| ManzanoModel Scale=30B, Date=2025.09, Tokenization Paradigm=Hybrid Tokenization2026.02 | 83.4 | |
| iLLaVAImage token reduction ratio=66.7%2024.12 | 83 | |
| iLLaVAImage token reduction ratio=77.8%2024.12 | 82.9 | |
| SparseVLMImage token reduction ratio=66.7%2024.12 | 82.7 | |
| Qwen2.5VLModel Scale=7B, Date=2025.02, Tokenization Paradigm=Understanding-only Models2026.02 | 82.6 | |
| VisionZipImage token reduction ratio=66.7%2024.12 | 82.5 | |
| PyramidDropImage token reduction ratio=66.7%2024.12 | 81.6 | |
| FasterVLMImage token reduction ratio=66.7%2024.12 | 81.2 | |
| ILLUME+#LLM=3B2025.12 | 80.8 | |
| SparseVLMImage token reduction ratio=77.8%2024.12 | 80.3 | |
| KelixModel Scale=8B, Tokenization Paradigm=Discrete Tokenization2026.02 | 80.2 | |
| STAR-3B#LLM=3B2025.12 | 80.1 | |
| iLLaVAImage token reduction ratio=88.9%2024.12 | 79.7 | |
| FasterVLMImage token reduction ratio=77.8%2024.12 | 79.6 | |
| VisionZipImage token reduction ratio=77.8%2024.12 | 79.5 | |
| Show-o2#LLM=7B2025.12 | 79.3 | |
| Janus-ProModel Scale=7B, Date=2025.01, Tokenization Paradigm=Discrete Tokenization2026.02 | 79.2 | |
| Janus-Pro#LLM=7B2025.12 | 79.2 | |
| VisionZipImage token reduction ratio=88.9%2024.12 | 79.2 | |
| FasterVLMImage token reduction ratio=88.9%2024.12 | 78.7 | |
| Blip-3oModel Scale=4B, Date=2025.05, Tokenization Paradigm=Continuous Tokenization2026.02 | 78.6 | |
| PyramidDropImage token reduction ratio=77.8%2024.12 | 78.5 | |
| SparseVLMImage token reduction ratio=88.9%2024.12 | 78.2 | |
| Ovis-U1#LLM=1.5B2025.12 | 77.8 | |
| MiniCPM-Llama3-V2.5Number of Parameters=8B, Evaluation Mode=Zero-shot2024.08 | 77.6 | |
| mPLUG-Owl3Number of Parameters=8B, Evaluation Mode=Zero-shot2024.08 | 77.6 | |
| EVLM-ChatNumber of Parameters=32B, Evaluation Mode=Zero-shot2024.08 | 76.9 | |
| Qwen2.5VLModel Scale=3B, Date=2025.02, Tokenization Paradigm=Understanding-only Models2026.02 | 76.4 | |
| Idefics2Number of Parameters=8B, Evaluation Mode=Zero-shot2024.08 | 75.7 | |
| Janus-ProModel Scale=1.5B, Date=2025.01, Tokenization Paradigm=Discrete Tokenization2026.02 | 75.5 | |
| Janus#LLM=1.3B2025.12 | 75.5 | |
| MetaMorph#LLM=8B2025.12 | 75.2 | |
| X-OmniModel Scale=7B, Date=2025.07, Tokenization Paradigm=Discrete Tokenization2026.02 | 74.8 | |
| X-Omni#LLM=7B2025.12 | 74.8 | |
| CambrianNumber of Parameters=8B, Evaluation Mode=Zero-shot2024.08 | 74.6 | |
| PyramidDropImage token reduction ratio=88.9%2024.12 | 74.4 | |
| VILA1.5Number of Parameters=8B, Evaluation Mode=Zero-shot2024.08 | 72.3 | |
| Seed-X#LLM=13B2025.12 | 70.1 | |
| Mantis-SigLIPNumber of Parameters=8B, Evaluation Mode=Zero-shot2024.08 | 68.7 | |
| LLAVA-NextNumber of Parameters=8B, Evaluation Mode=Zero-shot2024.08 | 67.4 | |
| CogVLMNumber of Parameters=17B, Evaluation Mode=Zero-shot2024.08 | 65.8 | |
| mPLUG-Owl2Number of Parameters=8B, Evaluation Mode=Zero-shot2024.08 | 64.5 | |
| LLAVA-1.5Number of Parameters=8B, Evaluation Mode=Zero-shot2024.08 | 64.3 | |
| Emu3Model Scale=8B, Date=2024.09, Tokenization Paradigm=Discrete Tokenization2026.02 | 58.5 | |
| EMU3#LLM=8B2025.12 | 58.5 | |
| InstructBLIPNumber of Parameters=13B, Evaluation Mode=Zero-shot2024.08 | 38.3 | |
| OpenFlamingoNumber of Parameters=9B, Evaluation Mode=Zero-shot2024.08 | 32.4 |