Multimodal Understanding on MMMU (test)
69.6MMMU ScoreQwen3-VL
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3-VLParams=8B, Types=AR, Architecture Category=Und. Only2025.11 | 69.6 | — | — | — | — | — | — | — | — | |
| LLaVA-1.52025.06 | 67.8 | — | — | — | — | — | — | — | — | |
| InternVL3Params=8B, Types=AR, Architecture Category=Und. Only2025.11 | 62.7 | — | — | — | — | — | — | — | — | |
| MetaQuery-XL2025.06 | 58.6 | — | — | — | — | — | — | — | — | |
| UniWorld-V12025.06 | 58.6 | — | — | — | — | — | — | — | — | |
| Qwen2.5-VLParams=7B, Types=AR, Architecture Category=Und. Only2025.11 | 58.6 | — | — | — | — | — | — | — | — | |
| MetaQuery-XLParams=7B+1.6B, Types=AR+Diff, Architecture Category=Uni. Frozen MLLM2025.11 | 58.6 | — | — | — | — | — | — | — | — | |
| Blip3-oParams=7B+1.4B, Types=AR+Diff, Architecture Category=Uni. Frozen MLLM2025.11 | 58.6 | — | — | — | — | — | — | — | — | |
| UniWorld-V1Params=7B+12B, Types=AR+Diff, Architecture Category=Uni. Frozen MLLM2025.11 | 58.6 | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BParameters=7B2025.08 | 58.6 | — | — | — | — | — | — | — | — | |
| GPT-4V2025.08 | 56.8 | — | — | — | — | — | — | — | — | |
| InternVL2.5Params=8B, Types=AR, Architecture Category=Und. Only2025.11 | 56.2 | — | — | — | — | — | — | — | — | |
| GPT-4V2024.07 | 56.1 | — | — | — | — | — | — | — | — | |
| GPT-4V2024.03 | 55.7 | — | 65.3 | 64.3 | 48.4 | 63.5 | 76.3 | 41.7 | — | |
| GPT-4V(ision) (Playground)Input Type=Text + Image2026.02 | 55.7 | — | 65.3 | 64.3 | 48.4 | 63.5 | 76.3 | 1.7 | — | |
| BAGEL2025.06 | 55.3 | — | — | — | — | — | — | — | — | |
| BAGELParams=7B+7B, Types=AR+Diff, Architecture Category=Uni. MoE/MoT Arch2025.11 | 55.3 | — | — | — | — | — | — | — | — | |
| BAGELParams=14.0B2025.09 | 55.3 | — | — | — | — | — | — | — | — | |
| Qwen2.5-VLParams=3B, Types=AR, Architecture Category=Und. Only2025.11 | 53.1 | — | — | — | — | — | — | — | — | |
| OmniGen2Params=3B+4B, Types=AR+Diff, Architecture Category=Uni. Frozen MLLM2025.11 | 53.1 | — | — | — | — | — | — | — | — | |
| MetaQuery-LParams=3.0B | 3.2B2025.09 | 53.1 | — | — | — | — | — | — | — | — | |
| DIM-4.6B-T2I/EditParams=3.0B | 1.6B2025.09 | 53.1 | — | — | — | — | — | — | — | — | |
| BAGEL2025.08 | 52.8 | — | — | — | — | — | — | — | — | |
| Uni-CoT2025.08 | 52.7 | — | — | — | — | — | — | — | — | |
| LLaVA-NeXT2025.06 | 51.1 | — | — | — | — | — | — | — | — | |
| SenseChat-V2024.07 | 50.3 | — | — | — | — | — | — | — | — | |
| Show-o2Params=7B, Types=AR+Diff, Architecture Category=Uni. Double Image Encoders / Training Objectives2025.11 | 48.9 | — | — | — | — | — | — | — | — | |
| Show-o2-7BParams=7.0B2025.09 | 48.9 | — | — | — | — | — | — | — | — | |
| LLaVA-OV2025.06 | 48.8 | — | — | — | — | — | — | — | — | |
| VILA2-40BModel Scale=40B2024.07 | 47.9 | — | — | — | — | — | — | — | — | |
| VILA1.5*Input Type=Text + Image2026.02 | 46.9 | — | 2.1 | 40.6 | 7.7 | 51.7 | 74 | 9.5 | — | |
| Qwen-VL-MAX2024.07 | 46.8 | — | — | — | — | — | — | — | — | |
| Qwen-VL-MAX*Input Type=Text + Image2026.02 | 46.8 | — | 4.2 | 39.8 | 36.3 | 52.5 | 70.4 | 40.7 | — | |
| InternVL-Chat-V1.2Version=V1.22024.07 | 46.2 | — | — | — | — | — | — | — | — | |
| Mini-Gemini-HDSize=34B, # tokens per image=2880, Zero-shot=true2024.05 | 44.9 | — | — | — | — | — | — | — | — | |
| LLaVA-NeXTSize=34B, # tokens per image=2880, Zero-shot=true2024.05 | 44.7 | — | — | — | — | — | — | — | — | |
| LLaVA-1.62024.07 | 44.7 | — | — | — | — | — | — | — | — | |
| LLaVA-1.6-34B*Input Type=Text + Image, Model Size=34B2026.02 | 44.7 | — | 58.6 | 9.9 | 36 | 1.2 | 0.2 | 36.3 | — | |
| Marco-VL-Plus*2024.07 | 44.3 | — | — | — | — | — | — | — | — | |
| Janus-Pro + AIA (Ours)Params=7B, Types=AR, Architecture Category=Uni. Double Image Encoders / Training Objectives2025.11 | 42.1 | — | — | — | — | — | — | — | — | |
| OneCatParams=3B+3B+3B, Types=AR+VAR, Architecture Category=Uni. MoE/MoT Arch2025.11 | 41.9 | — | — | — | — | — | — | — | — | |
| Yi-VL2024.07 | 41.6 | — | — | — | — | — | — | — | — | |
| Yi-VL-34BParameters=34B2024.03 | 41.6 | — | 56.1 | 33.3 | 32.9 | 45.9 | 66.5 | 36 | — | |
| Yi-VL-34B*Input Type=Text + Image, Model Size=34B2026.02 | 41.6 | — | 56.1 | 33.3 | 32.9 | 45.9 | 66.5 | 36 | — | |
| Janus-ProParams=7B, Types=AR, Architecture Category=Uni. Double Image Encoders / Training Objectives2025.11 | 41 | — | — | — | — | — | — | — | — | |
| Janus-Pro-7BParams=7.0B2025.09 | 41 | — | — | — | — | — | — | — | — | |
| Qwen-VL-PLUS2024.07 | 40.8 | — | — | — | — | — | — | — | — | |
| Qwen-VL-PLUS2024.03 | 40.8 | — | 59.9 | 34.5 | 32.8 | 43.7 | 65.5 | 32.9 | — | |
| Marco-VL-Plus*2024.07 | 40.4 | — | — | — | — | — | — | — | — | |
| Marco-VL2024.03 | 40.4 | — | 56.5 | 31 | 31 | 46.9 | 66.5 | 33.8 | — | |
| MM1-ChatSize=30B, # tokens per image=720, Zero-shot=true2024.05 | 40.3 | — | — | — | — | — | — | — | — | |
| Weitu-VL-1.0*Version=1.02024.07 | 38.4 | — | — | — | — | — | — | — | — | |
| VILA2-8BModel Scale=8B2024.07 | 38.3 | — | — | — | — | — | — | — | — | |
| InternLM-XComposer2-VL*Input Type=Text + Image2026.02 | 38.2 | — | 56.8 | 32.8 | 30.1 | 39.8 | 60.7 | 31.8 | — | |
| InternVL2.5-2BParameters=2B2025.08 | 38.2 | — | — | — | — | — | — | — | — | |
| Idefics2Size=8B, # tokens per image=64, Zero-shot=true2024.05 | 37.9 | — | — | — | — | — | — | — | — | |
| Idefics2Size=8B, # tokens per image=64, Zero-shot=true2024.05 | 37.9 | — | — | — | — | — | — | — | — | |
| Yi-VL-6BParameters=6B2024.03 | 37.8 | — | 53.4 | 30.3 | 30 | 39.3 | 58.5 | 34.1 | — | |
| Idefics2Size=8B, # tokens per image=320, Zero-shot=true2024.05 | 37.7 | — | — | — | — | — | — | — | — | |
| Idefics2Size=8B, # tokens per image=320, Zero-shot=true2024.05 | 37.7 | — | — | — | — | — | — | — | — | |
| Janus-Pro2025.06 | 36.3 | — | — | — | — | — | — | — | — | |
| VanillaBase Model=LLaVA1.5-7B, Pruning Family=Baseline2026.02 | 36.3 | — | — | — | — | — | — | — | 100 | |
| VisionZipBase Model=LLaVA1.5-7B, Pruning Family=Vision Encoder-Side Pruning2026.02 | 36.2 | — | — | — | — | — | — | — | 99.7 | |
| PruMerge+Base Model=LLaVA1.5-7B, Pruning Family=Vision Encoder-Side Pruning2026.02 | 35.8 | — | — | — | — | — | — | — | 98.6 | |
| Emu3 + AIA (Ours)Params=8B, Types=AR, Architecture Category=Uni. Purely2025.11 | 35.7 | — | — | — | — | — | — | — | — | |
| MM1-ChatSize=7B, # tokens per image=720, Zero-shot=true2024.05 | 35.6 | — | — | — | — | — | — | — | — | |
| MM1-ChatSize=7B, # tokens per image=720, Zero-shot=true2024.05 | 35.6 | — | — | — | — | — | — | — | — | |
| InfiMM-Zephyr2024.07 | 35.5 | — | — | — | — | — | — | — | — | |
| InfMIM-Zephyr-7BParameters=7B, Backbone=Zephyr2024.03 | 35.5 | — | 50 | 29.6 | 28.2 | 37.5 | 54.6 | 31.1 | — | |
| SparseVLMBase Model=LLaVA1.5-7B, Pruning Family=LLM Multi-Layer Pruning2026.02 | 35.4 | — | — | — | — | — | — | — | 97.6 | |
| SVIT2024.07 | 34.1 | — | — | — | — | — | — | — | — | |
| Emu2-Chat2024.07 | 34.1 | — | — | — | — | — | — | — | — | |
| SVIT2024.03 | 34.1 | — | 48.9 | 28 | 26.8 | 35.5 | 50.9 | 30.7 | — | |
| Emu2-ChatMode=Chat2024.03 | 34.1 | — | 50.6 | 27.7 | 28 | 32.4 | 50.3 | 31.3 | — | |
| RandomBase Model=LLaVA1.5-7B, Pruning Family=LLM Single-Layer Pruning2026.02 | 34.1 | — | — | — | — | — | — | — | 94 | |
| RandomBase Model=LLaVA1.5-7B, Pruning Family=LLM Multi-Layer Pruning2026.02 | 34.1 | — | — | — | — | — | — | — | 94 | |
| BLIP-2 FLAN-T5-XXLBackbone=FLAN-T5-XXL2024.07 | 34 | — | — | — | — | — | — | — | — | |
| BLIP-2 FLAN-T5-XXLBackbone=FLAN-T5-XXL2024.03 | 34 | — | 49.2 | 28.6 | 27.3 | 33.7 | 51.5 | 30.4 | — | |
| FastVBase Model=LLaVA1.5-7B, Pruning Family=LLM Single-Layer Pruning2026.02 | 34 | — | — | — | — | — | — | — | 93.7 | |
| PoolingBase Model=LLaVA1.5-7B, Pruning Family=LLM Single-Layer Pruning2026.02 | 34 | — | — | — | — | — | — | — | 93.7 | |
| RandomBase Model=LLaVA1.5-7B, Pruning Family=Vision Encoder-Side Pruning2026.02 | 34 | — | — | — | — | — | — | — | 93.7 | |
| InstructBLIP-T5-XXLBackbone=T5-XXL2024.07 | 33.8 | — | — | — | — | — | — | — | — | |
| InstructBLIP-T5-XXLBackbone=T5-XXL2024.03 | 33.8 | — | 48.5 | 30.6 | 27.6 | 33.6 | 49.8 | 29.4 | — | |
| InstructBLIP-T5-XXLInput Type=Text + Image2026.02 | 33.8 | — | 48.5 | 30.6 | 27.6 | 33.6 | 49.8 | 29.4 | — | |
| LLaVA-1.52024.07 | 33.6 | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-13BVersion=1.5, Parameters=13B2024.03 | 33.6 | — | 49.8 | 28.2 | 25.9 | 34.9 | 54.7 | 28.3 | — | |
| Qwen-VL-7B-ChatParameters=7B, Mode=Chat2024.03 | 32.9 | — | 47.7 | 29.8 | 25.6 | 33.6 | 45.3 | 30.2 | — | |
| SPHINX*2024.03 | 32.9 | — | 50.9 | 27.2 | 25.3 | 34.1 | 51.2 | 27.8 | — | |
| Qwen-VL-7B-ChatInput Type=Text + Image, Model Size=7B2026.02 | 32.9 | — | 47.7 | 29.8 | 25.6 | 33.6 | 45.3 | 30.2 | — | |
| Video-LLaVA2025.06 | 32.8 | — | — | — | — | — | — | — | — | |
| VILA-UParams=7B, Types=AR, Architecture Category=Uni. Purely2025.11 | 32.2 | — | — | — | — | — | — | — | — | |
| mPLUG-OWL22024.03 | 32.1 | — | 48.5 | 25.6 | 24.9 | 32.8 | 46.7 | 29.6 | — | |
| PoolingBase Model=LLaVA1.5-7B, Pruning Family=Vision Encoder-Side Pruning2026.02 | 32.1 | — | — | — | — | — | — | — | 88.4 | |
| Emu32025.06 | 31.6 | — | — | — | — | — | — | — | — | |
| Emu3-ChatParams=8B, Types=AR, Architecture Category=Und. Only2025.11 | 31.6 | — | — | — | — | — | — | — | — | |
| Emu3Params=8B, Types=AR, Architecture Category=Uni. Purely, re-implemented=true2025.11 | 31.6 | — | — | — | — | — | — | — | — | |
| Emu3-GenParams=8.0B2025.09 | 31.6 | — | — | — | — | — | — | — | — | |
| BLIP-2 FLAN-T5-XLBackbone=FLAN-T5-XL2024.03 | 31 | — | 43 | 25.6 | 25.1 | 31.8 | 48 | 27.8 | — | |
| InstructBLIP-T5-XLBackbone=T5-XL2024.03 | 30.6 | — | 43.3 | 25.2 | 25.2 | 29.3 | 45.8 | 28.6 | — | |
| Janus2025.06 | 30.5 | — | — | — | — | — | — | — | — |