Multi-discipline Multimodal Understanding on MMMU Pro
67.3AccuracyGPT-5-Mini
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-5-Mini2025.12 | 67.3 | — | — | |
| InternVL3.5-38B2025.12 | 66 | — | — | |
| Qwen3-VL-32B2025.12 | 65.3 | — | — | |
| GLM-4.5V2025.12 | 65.2 | — | — | |
| InternVL3-78B2025.12 | 62.3 | — | — | |
| Claude-4-Sonnet2025.12 | 61.6 | — | — | |
| Qwen3-VL-8B-MastersSize=8B2025.12 | 61.4 | — | — | |
| MastersBase Model=Qwen3-VL-8B2025.12 | 61.4 | — | — | |
| Qwen2.5-VL-72B2025.12 | 61.2 | — | — | |
| Qwen2.5-VL-7B-MastersSize=7B2025.12 | 60.6 | — | — | |
| MastersBase Model=Qwen2.5-VL-7B2025.12 | 60.6 | — | — | |
| InternVL3-8B-MastersSize=8B2025.12 | 58.8 | — | — | |
| MastersBase Model=InternVL3-8B2025.12 | 58.8 | — | — | |
| InternVL3.5-8B-MastersSize=8B2025.12 | 58.1 | — | — | |
| MastersBase Model=InternVL3.5-8B2025.12 | 58.1 | — | — | |
| InternVL3.5-8BSize=8B2025.12 | 57.2 | — | — | |
| Qwen3-VL-4B-MastersSize=4B2025.12 | 57 | — | — | |
| Claude-3.7-Sonnet2025.12 | 56.5 | — | — | |
| Qwen3-VL-8BSize=8B2025.12 | 55.9 | — | — | |
| Qwen3-VLModel Size=8B2026.03 | 55.9 | — | — | |
| Active-ZeroBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 54.62 | — | — | |
| Gemini-2.0-Flash2025.12 | 54.4 | — | — | |
| Qwen3-VL-4BSize=4B2025.12 | 53.2 | — | — | |
| InternVL3.5-4B-MastersSize=4B2025.12 | 52.7 | — | — | |
| Base ModelBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 52.61 | — | — | |
| InternVL3.5-2B-MastersSize=2B2025.12 | 52.4 | — | — | |
| VisionZero-RealWorldBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 52.29 | — | — | |
| VisionZero-CLEVRBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 52.17 | — | — | |
| VisPlayBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 51.98 | — | — | |
| GPT-4o2025.12 | 51.9 | — | — | |
| VisionZero-ChartBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 51.67 | — | — | |
| EvoLMMBackbone=Qwen2.5-VL-7B-Instruct2026.02 | 51.6 | — | — | |
| Claude-3.5-Sonnet2025.12 | 51.5 | — | — | |
| InternVL3.5-4BSize=4B2025.12 | 51.4 | — | — | |
| Qwen2.5-VL-3B-MastersSize=3B2025.12 | 51 | — | — | |
| Gemini-1.5-Pro2025.12 | 46.9 | — | — | |
| Active-ZeroBackbone=Qwen2.5-VL-3B-Instruct2026.02 | 46.7 | — | — | |
| InternVL3.5-2BSize=2B2025.12 | 46.3 | — | — | |
| MiMo-VL-8BSize=8B2025.12 | 46.2 | — | — | |
| VisPlayBackbone=Qwen2.5-VL-3B-Instruct2026.02 | 42.43 | — | — | |
| Base ModelBackbone=Qwen2.5-VL-3B-Instruct2026.02 | 41.99 | — | — | |
| InternVL3-8BSize=8B2025.12 | 41.3 | — | — | |
| Penguin-VLModel Size=8B2026.03 | 40.2 | — | — | |
| InternVL3-2B-MastersSize=2B2025.12 | 40.1 | — | — | |
| VideoAuto-R1Backbone=Qwen2.5-VL-7B2026.01 | 39.8 | — | — | |
| InternVL-3.5Model Size=8B2026.03 | 39.7 | — | — | |
| Qwen3-VL-2B-MastersSize=2B2025.12 | 39.5 | — | — | |
| Phi-4-Multimodal-5.6BSize=5.6B2025.12 | 38.5 | — | — | |
| Qwen2.5-VL-7BSize=7B2025.12 | 38.3 | — | — | |
| LLaVA-OneVision-1.5-8BSize=8B2025.12 | 37.4 | — | — | |
| Qwen3-VL-2BSize=2B2025.12 | 36.5 | — | — | |
| OpenAI GPT-5 nanoModel Size=nano2026.03 | 36.5 | — | — | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.01 | 36.1 | — | — | |
| LLaVA-OneVision-1.5-4BSize=4B2025.12 | 35.3 | — | — | |
| Qwen2.5-VL-3BSize=3B2025.12 | 31.6 | — | — | |
| LLaVA-OneVision-72B2025.12 | 31 | — | — | |
| BaseTraining Stage=Base, RL Alignment (GRPO)=false2025.08 | 29.59 | — | — | |
| BaseTraining Stage=Base, RL Alignment (GRPO)=true2025.08 | 28.61 | — | — | |
| PSFTTraining Stage=PSFT, RL Alignment (GRPO)=false2025.08 | 27.63 | — | — | |
| MiniCPM-V2.6-8BSize=8B2025.12 | 27.2 | — | — | |
| PSFTTraining Stage=PSFT, RL Alignment (GRPO)=true2025.08 | 26.07 | — | — | |
| InternVL3-2BSize=2B2025.12 | 24.9 | — | — | |
| LLaVA-OneVision-7BSize=7B2025.12 | 24.1 | — | — | |
| SFTTraining Stage=SFT, RL Alignment (GRPO)=false2025.08 | 23.58 | — | — | |
| Phi-3.5-Vision-4BSize=4B2025.12 | 19.7 | — | — | |
| SFTTraining Stage=SFT, RL Alignment (GRPO)=true2025.08 | 19.6 | — | — | |
| AVAR-ThinkerModel Category=Our model2026.03 | — | 42.9 | — | |
| Cambrian-1LLM Backbone=LLaMA3-8B, Open Data=true2025.12 | — | 14.7 | — | |
| Claude 3.5 SonnetLLM Backbone=-, Open Data=false2025.12 | — | 48 | — | |
| Claude-3.7-SonnetModel Category=Closed-Source2026.03 | — | 50.1 | — | |
| COMPACTRecipe=COMPACT2025.04 | — | 20.23 | 11.91 | |
| Dream-VLLLM Backbone=Dream 7B, Open Data=true, Input Mode=Single Image2025.12 | — | 25.8 | — | |
| Dream-VLLLM Backbone=Dream 7B, Open Data=true2025.12 | — | 26 | — | |
| Gemini-1.5 ProLLM Backbone=-, Open Data=false2025.12 | — | 44.4 | — | |
| GPT-4oLLM Backbone=-, Open Data=false2025.12 | — | 49.7 | — | |
| GPT-4oModel Category=Closed-Source2026.03 | — | 54.5 | — | |
| InternVL2.5-8BModel Category=Open-Source General Models2026.03 | — | 38.2 | — | |
| LLaDA-VLLM Backbone=LLaDA 8B, Open Data=true2025.12 | — | 18.6 | — | |
| Llama-3.2-11B-Vision-InstructModel Category=Open-Source General Models2026.03 | — | 33 | — | |
| LLaVA-665KRecipe=LLaVA-665K2025.04 | — | 20.12 | 11.97 | |
| Llava-CoT-11BLLM Backbone=LLaMA3.2-11B, Open Data=true2025.12 | — | 18.5 | — | |
| LLaVA-OneVision-7BModel Category=Open-Source General Models2026.03 | — | 35.5 | — | |
| LLaVA-OVLLM Backbone=Qwen2-7B, Open Data=true, Input Mode=Single Image2025.12 | — | 16.8 | — | |
| LLaVA-OVLLM Backbone=Qwen2-7B, Open Data=true2025.12 | — | 18.7 | — | |
| MAmmoTH-VLLLM Backbone=Qwen2.5-7B, Open Data=true, Input Mode=Single Image2025.12 | — | 26 | — | |
| MAmmoTH-VLLLM Backbone=Qwen2.5-7B, Open Data=true2025.12 | — | 25.3 | — | |
| MiMo-VL-RLLLM Backbone=MiMo-7B, Open Data=false2025.12 | — | 40.3 | — | |
| MM-Eureka-7BModel Category=Multimodal Reasoning Models2026.03 | — | 42.4 | — | |
| Molmo-8B-DLLM Backbone=Qwen2 7B, Open Data=true2025.12 | — | 18.9 | — | |
| Mulberry-7BModel Category=Multimodal Reasoning Models2026.03 | — | 34.8 | — | |
| OpenVLThinkerModel Category=Multimodal Reasoning Models2026.03 | — | 42.9 | — | |
| Qwen2.5-VL-7BModel Category=Open-Source General Models2026.03 | — | 38.3 | — | |
| R1-OneVisionModel Category=Multimodal Reasoning Models2026.03 | — | 32.2 | — | |
| RandomRecipe=Random2025.04 | — | 18.15 | 11.44 | |
| ThinkLite-VLModel Category=Multimodal Reasoning Models2026.03 | — | 40 | — | |
| Vision-R1Model Category=Multimodal Reasoning Models2026.03 | — | 39.6 | — | |
| Vision-SR1Model Category=Multimodal Reasoning Models2026.03 | — | 43.8 | — | |
| VLAA-Thinker-7BModel Category=Multimodal Reasoning Models2026.03 | — | 40.9 | — |