Multi-modal Question Answering on MMMU
82.3AccuracyQwen3.5-27B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3.5-27BMode=REASONING, Architecture=Dense, # Total Params=27B, # Activated Params=27B2026.04 | 82.3 | |
| Qwen3-VL-235B-A22BMode=Thinking, Architecture=MoE, # Total Params=236B, # Activated Params=23B2026.04 | 80.6 | |
| GPT-5 miniMode=REASONING: HIGH, Architecture=-, # Total Params=-, # Activated Params=-2026.04 | 79 | |
| EXAONE 4.5 33BMode=REASONING, Architecture=Dense, # Total Params=33B, # Activated Params=33B2026.04 | 78.7 | |
| Qwen3-VL-32BMode=Thinking, Architecture=Dense, # Total Params=33B, # Activated Params=33B2026.04 | 78.1 | |
| Qwen3-VLArchitecture Type=Modular, Parameter Scale=8B, Instruction Tuning=Instruct2026.05 | 69.6 | |
| InternVL3.5Architecture Type=Modular, Parameter Scale=8B, Instruction Tuning=Instruct2026.05 | 68.1 | |
| NEO-ovArchitecture Type=Native, Parameter Scale=8B, Instruction Tuning=Instruct2026.05 | 68.1 | |
| InternVL3Architecture Type=Modular, Parameter Scale=8B, Instruction Tuning=Instruct2026.05 | 62.7 | |
| OneVision-8BModel=OneVision-8B2026.06 | 55.6 | |
| Qwen2.5-VLArchitecture Type=Modular, Parameter Scale=8B, Instruction Tuning=Instruct2026.05 | 55 | |
| NEO-ovArchitecture Type=Native, Parameter Scale=2B, Instruction Tuning=Instruct2026.05 | 54.7 | |
| NEOArchitecture Type=Native, Parameter Scale=8B, Instruction Tuning=Instruct2026.05 | 54.6 | |
| ReVisiTModel Backbone=InternVL3-8B2025.06 | 54.14 | |
| GreedyModel Backbone=InternVL3-8B2025.06 | 53.54 | |
| M3IDModel Backbone=InternVL3-8B2025.06 | 53.43 | |
| Qwen3-VLArchitecture Type=Modular, Parameter Scale=2B, Instruction Tuning=Instruct2026.05 | 53.4 | |
| DoLaModel Backbone=InternVL3-8B2025.06 | 53.08 | |
| InternVL3.5Architecture Type=Modular, Parameter Scale=2B, Instruction Tuning=Instruct2026.05 | 53 | |
| VCDModel Backbone=InternVL3-8B2025.06 | 52.6 | |
| CODEModel Backbone=InternVL3-8B2025.06 | 52.41 | |
| OneVision-4BModel=OneVision-4B2026.06 | 52 | |
| SIDModel Backbone=InternVL3-8B2025.06 | 51.85 | |
| ReVisiTModel Backbone=Qwen2.5-VL-7B2025.06 | 51.18 | |
| VCDModel Backbone=Qwen2.5-VL-7B2025.06 | 51.13 | |
| GreedyModel Backbone=Qwen2.5-VL-7B2025.06 | 51.11 | |
| VisionThink-7B2025.10 | 51 | |
| MergeMixbaseline=SFT Vision2025.10 | 51 | |
| AttWarp-ChainBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Adaptive Chains2025.10 | 51 | |
| SFT Vision2025.10 | 50.89 | |
| AttWarpBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Rectilinear warping2025.10 | 50.4 | |
| Qwen2.5-VL-Ins-7B2025.10 | 50.3 | |
| DoLaModel Backbone=Qwen2.5-VL-7B2025.06 | 50.15 | |
| SIDModel Backbone=Qwen2.5-VL-7B2025.06 | 49.75 | |
| InternVL-2.0Params (B)=8, Text Gen Arch=AR, Image Gen Arch=-2025.05 | 49.3 | |
| Llama-90BModel=Llama-90B2026.06 | 49.2 | |
| AttWarp-DistillBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Efficient inference2025.10 | 48.9 | |
| OneVision-4B-LNModel=OneVision-4B-LN2026.06 | 48.8 | |
| InternVL3Architecture Type=Modular, Parameter Scale=2B, Instruction Tuning=Instruct2026.05 | 48.6 | |
| NEOArchitecture Type=Native, Parameter Scale=2B, Instruction Tuning=Instruct2026.05 | 48.6 | |
| InternVL2-8BModel=InternVL2-8B2026.06 | 48.3 | |
| APIBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Alpha channel fade2025.10 | 47.4 | |
| Base MLLMBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Cross-attention VL adapter & partially closed data2025.10 | 47.3 | |
| ViCropBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Add object crop2025.10 | 47.1 | |
| M3IDModel Backbone=Qwen2.5-VL-7B2025.06 | 46.63 | |
| FGVP-blurBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Blur background2025.10 | 46.5 | |
| FGVP-maskBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Green mask overlay2025.10 | 46 | |
| SoMBase MLLM=Qwen (Yang et al., 2024a), Key Technique=Grounded segments2025.10 | 45.1 | |
| CODEModel Backbone=Qwen2.5-VL-7B2025.06 | 42.79 | |
| BREENArchitecture Type=Native, Parameter Scale=8B, Instruction Tuning=Instruct2026.05 | 42.7 | |
| AttWarp-ChainBase MLLM=LLaVA (Liu et al., 2024a), Key Technique=Adaptive Chains2025.10 | 41.6 | |
| Cambrian-8BModel=Cambrian-8B2026.06 | 41.5 | |
| Qwen2-VLArchitecture Type=Modular, Parameter Scale=2B, Instruction Tuning=Instruct2026.05 | 41.1 | |
| AttWarpBase MLLM=LLaVA (Liu et al., 2024a), Key Technique=Rectilinear warping2025.10 | 40.4 | |
| OptMergeBackbone=InternVL2.5-VL-1B2025.05 | 39.33 | |
| OptMergeBackbone=InternVL2.5-1B2026.06 | 39.33 | |
| SWUDI-ABackbone=InternVL2.5-1B2026.06 | 39.33 | |
| EVEv2Architecture Type=Native, Parameter Scale=8B, Instruction Tuning=Instruct2026.05 | 39.3 | |
| Mono-VL1.5Architecture Type=Native, Parameter Scale=2B, Instruction Tuning=Instruct2026.05 | 39.1 | |
| OneCATArchitecture Type=Native, Parameter Scale=2B, Instruction Tuning=Instruct2026.05 | 39 | |
| AttWarp-DistillBase MLLM=LLaVA (Liu et al., 2024a), Key Technique=Efficient inference2025.10 | 38.8 | |
| Individual OCRBackbone=InternVL2.5-VL-1B2025.05 | 38 | |
| Individual OCRBackbone=InternVL2.5-1B2026.06 | 38 | |
| ViCropBase MLLM=LLaVA (Liu et al., 2024a), Key Technique=Add object crop2025.10 | 37.2 | |
| Base MLLMBase MLLM=LLaVA (Liu et al., 2024a), Key Technique=MLP vision-language connector & open data2025.10 | 36.9 | |
| APIBase MLLM=LLaVA (Liu et al., 2024a), Key Technique=Alpha channel fade2025.10 | 36.9 | |
| LLaVA-NextParams (B)=13, Text Gen Arch=AR, Image Gen Arch=-2025.05 | 36.2 | |
| FGVP-maskBase MLLM=LLaVA (Liu et al., 2024a), Key Technique=Green mask overlay2025.10 | 36.1 | |
| QWEN-VLParams (B)=7, Text Gen Arch=AR, Image Gen Arch=-2025.05 | 35.9 | |
| LLaVA-7BModel=LLaVA-7B2026.06 | 35.7 | |
| SoMBase MLLM=LLaVA (Liu et al., 2024a), Key Technique=Grounded segments2025.10 | 35.6 | |
| ReVisiTModel Backbone=LLaVA-1.5-7B2025.06 | 35.13 | |
| FGVP-blurBase MLLM=LLaVA (Liu et al., 2024a), Key Technique=Blur background2025.10 | 35 | |
| LLaVA-13BModel=LLaVA-13B2026.06 | 34.7 | |
| M3IDModel Backbone=LLaVA-1.5-7B2025.06 | 34.51 | |
| CODEModel Backbone=LLaVA-1.5-7B2025.06 | 34.48 | |
| BLIP-2Params (B)=13, Text Gen Arch=AR, Image Gen Arch=-2025.05 | 34.4 | |
| GreedyModel Backbone=LLaVA-1.5-7B2025.06 | 34.39 | |
| DoLaModel Backbone=LLaVA-1.5-7B2025.06 | 34.29 | |
| Individual GroundingBackbone=InternVL2.5-VL-1B2025.05 | 34.22 | |
| Individual GroundingBackbone=InternVL2.5-1B2026.06 | 34.22 | |
| Mono-VLArchitecture Type=Native, Parameter Scale=2B, Instruction Tuning=Instruct2026.05 | 33.7 | |
| Individual GeometryBackbone=InternVL2.5-VL-1B2025.05 | 33.67 | |
| Individual GeometryBackbone=InternVL2.5-1B2026.06 | 33.67 | |
| VCDModel Backbone=LLaVA-1.5-7B2025.06 | 33.51 | |
| SIDModel Backbone=LLaVA-1.5-7B2025.06 | 33.1 | |
| EVEArchitecture Type=Native, Parameter Scale=8B, Instruction Tuning=Instruct2026.05 | 32.6 | |
| HoVLEArchitecture Type=Native, Parameter Scale=2B, Instruction Tuning=Instruct2026.05 | 32.2 | |
| VoRAArchitecture Type=Native, Parameter Scale=8B, Instruction Tuning=Instruct2026.05 | 32 | |
| Individual ChartBackbone=InternVL2.5-VL-1B2025.05 | 30.33 | |
| Individual ChartBackbone=InternVL2.5-1B2026.06 | 30.33 | |
| OpenFlamingoParams (B)=9, Text Gen Arch=AR, Image Gen Arch=-2025.05 | 28.7 | |
| MudditParams (B)=1, Text Gen Arch=Discrete Diff., Image Gen Arch=Discrete Diff., Resolution=1024×10242025.05 | 28.7 | |
| FuyuArchitecture Type=Native, Parameter Scale=8B, Instruction Tuning=Instruct2026.05 | 27.9 | |
| MudditParams (B)=1, Text Gen Arch=Discrete Diff., Image Gen Arch=Discrete Diff., Resolution=512×5122025.05 | 27.6 | |
| Show-OParams (B)=1.3, Text Gen Arch=AR, Image Gen Arch=Discrete Diff., Resolution=512×5122025.05 | 27.4 | |
| Individual VQABackbone=InternVL2.5-VL-1B2025.05 | 26 | |
| Individual VQABackbone=InternVL2.5-1B2026.06 | 26 |