Multimodal Perception on MME P
1,682.6MME-P ScoreBLIP3-o
Evaluation Results
| Method | Links | |
|---|---|---|
| BLIP3-oLLM=Qwen2.5VL-7B-Instruct, Token Type=2D-Continuous dynamic2026.05 | 1,682.6 | |
| LLaVA-OneVisionLLM=Qwen2-7B, Token Type=2D-Continuous, Res.=3842026.05 | 1,580 | |
| ShareGPT4VLLM=Vicuna-7B, Token Type=2D-Continuous, Res.=3362026.05 | 1,567.4 | |
| Janus-ProLLM=DeepSeek-LLM-7B, Token Type=2D-Continuous, Res.=3842026.05 | 1,567.1 | |
| Lumina-DiMOO + OursBase Model=Lumina-DiMOO, Reproduction Status=Reproduced, Method Variation=With Mask Prior Suppression and Monotonic RoPE Scaling2026.05 | 1,553.1 | |
| WinTokLLM=Qwen3-8B, Token Type=1D-Continuous, Res.=2562026.05 | 1,552 | |
| Lumina-DiMOOBase Model=Lumina-DiMOO, Reproduction Status=Reproduced, Method Variation=Baseline2026.05 | 1,543.6 | |
| Lumina-DiMOOBase Model=Lumina-DiMOO, Reproduction Status=Reported, Method Variation=Original2026.05 | 1,534.2 | |
| LLaVA-v1.5LLM=Vicuna-7B, Token Type=2D-Continuous, Res.=3362026.05 | 1,510.7 | |
| Qwen2-VL-2B#Params=2B, TFLOPs=0.42025.06 | 1,501.4 | |
| LaTtE-Flow#Params=2B, TFLOPs=0.42025.06 | 1,501.4 | |
| TokLIPLLM=Qwen2.5-7B-Instruct, Token Type=1D-Continuous, Res.=3842026.05 | 1,496.6 | |
| VQRAELLM=Vicuna-13B, Token Type=2D-Continuous, Res.=2562026.05 | 1,491.1 | |
| VARGPTLLM=Vicuna-7B, Token Type=2D-Continuous, Res.=2562026.05 | 1,488.8 | |
| SEED-XLLM=LLaMA2-13B, Token Type=2D-Continuous, Res.=4482026.05 | 1,457 | |
| Seed-X#Params=17B, TFLOPs=11.12025.06 | 1,457 | |
| SemHiTokLLM=Qwen2.5-7B-Instruct, Token Type=2D-Discrete, Res.=2562026.05 | 1,449 | |
| UniTokLLM=LLaMA2-7B, Token Type=2D-Discrete, Res.=2562026.05 | 1,448 | |
| ILLUMELLM=Vicuna-7B, Token Type=2D-Continuous, Res.=2242026.05 | 1,445.3 | |
| Janus Pro#Params=1.5B, TFLOPs=0.82025.06 | 1,444 | |
| MMaDABase Model=MMaDA, Reproduction Status=Reported, Method Variation=Original2026.05 | 1,410.7 | |
| VILA-U#Params=7B, TFLOPs=3.62025.06 | 1,401.8 | |
| WinTokLLM=Qwen3-8B, Token Type=1D-Continuous, Res.=256, semantic tokens=642026.05 | 1,370.4 | |
| TokenFlow-LLLM=Vicuna-13B, Token Type=2D-Discrete, Res.=2562026.05 | 1,365.4 | |
| Janus#Params=1.5B, TFLOPs=0.82025.06 | 1,338 | |
| VILA-ULLM=LLaMA2-7B, Token Type=2D-Discrete, Res.=2562026.05 | 1,336.2 | |
| Emu3LLM=8B (from scratch), Token Type=2D-Discrete, Res.=5122026.05 | 1,243.8 | |
| EMU3#Params=8B, TFLOPs=4.12025.06 | 1,243.8 | |
| LiquidLLM=Gemma-7B, Token Type=2D-Discrete, Res.=5122026.05 | 1,119 | |
| MMaDA + OursBase Model=MMaDA, Reproduction Status=Reproduced, Method Variation=With Mask Prior Suppression and Monotonic RoPE Scaling2026.05 | 1,117.2 | |
| Show-oLLM=Phi-1.5-1.3B, Token Type=2D-Discrete, Res.=2562026.05 | 1,097.2 | |
| Show-o#Params=1.3B, TFLOPs=0.72025.06 | 1,097.2 | |
| MMaDABase Model=MMaDA, Reproduction Status=Reproduced, Method Variation=Baseline2026.05 | 1,070.6 | |
| Chameleon#Params=34B, TFLOPs=17.42025.06 | 604.5 | |
| Chameleon#Params=7B, TFLOPs=3.62025.06 | 202.7 |