Multimodal Understanding on MMMU
81.8AccuracyGPT-5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-52026.02 | 81.8 | — | |
| Qwen3-VL-30B-CoTModel Size=30B, Thinking Mode=CoT2026.02 | 76 | — | |
| InternVL3.5-8B-MPOTraining=DF-GRPO2026.03 | 74.8 | — | |
| Gemini-2.5-Pro2026.02 | 74.7 | — | |
| InternVL3.5-8B-MPOTraining=PRIME2026.03 | 73.6 | — | |
| InternVL3.5-8B-MPOTraining=GRPO2026.03 | 73.4 | — | |
| ReMoT-4b-CoTModel Size=4b, Thinking Mode=CoT2026.02 | 71.4 | — | |
| InternVL3.5-8B-MPOTraining=MPO2026.03 | 71.2 | — | |
| Qwen3-VL-4B-CoTModel Size=4B, Thinking Mode=CoT2026.02 | 70.8 | — | |
| GPT-4o2026.02 | 70.7 | — | |
| Qwen2.5-VL-32BTraining=DF-GSPO2026.03 | 70.6 | — | |
| InternVL2.5-78B2025.06 | 70.1 | — | |
| R1-ShareVL-32B2026.03 | 70.1 | — | |
| Qwen2.5-VL-32BTraining=Base2026.03 | 70 | — | |
| GPT-4o (0806)Model Version=08062024.12 | 69.9 | — | |
| VLSI-7BSize=7B2024.12 | 69.3 | — | |
| GPT-4o (0513)2025.06 | 69.1 | — | |
| Claude-3.5-Sonnet2025.06 | 68.3 | — | |
| InternVL2.5-8B-GenRecalTeacher VLM=InternVL2.5-78B2025.06 | 68.1 | — | |
| Qwen2.5-VL-32BTraining=GSPO2026.03 | 66.8 | — | |
| Claude3.5-Sonnet2024.12 | 65.9 | — | |
| InternVL2.5-8B-GenRecalTeacher VLM=Qwen2-VL-72B2025.06 | 65.6 | — | |
| InternVL2.5-8B-GenRecalTeacher VLM=InternVL2-76B2025.06 | 64.6 | — | |
| Qwen2-VL-72B2025.06 | 64.5 | — | |
| Qwen2-VL-72BSize=72B2024.12 | 64.3 | — | |
| InternVL2-76B2025.06 | 62.7 | — | |
| Gemini-1.5-Pro2025.06 | 62.2 | — | |
| InternVL3-8BModel Category=MMU-Experts2026.03 | 62.2 | — | |
| GPT-4V (0409)Model Version=04092024.12 | 61.7 | — | |
| FP16Model=Qwen2-VL-72B, Bitwidth=FP162024.12 | 61.1 | 78.1 | |
| Qwen2.5vl-InstructModel Scale=7B, Training Protocol=PSO, Category=Open-Source Reasoning MLLMs2025.12 | 60.9 | — | |
| NVLM-D-72BSize=72B2024.12 | 60.8 | — | |
| LLaVANextData=OmniAlign-Vmix, LLM=Qwen2.5-32B2025.02 | 60.7 | — | |
| Gemini-1.5-Pro2024.12 | 60.6 | — | |
| LLaMA-3.2-Vision2024.12 | 60.3 | — | |
| InternVL2.5-8B-GenRecalTeacher VLM=NVLM-72B2025.06 | 60.3 | — | |
| VAPOModel Scale=7B2025.09 | 60.2 | — | |
| NVLM-72B2025.06 | 59.7 | — | |
| AWQModel=Qwen2-VL-72B, Bitwidth=W3A162024.12 | 59.6 | 77.5 | |
| MBQModel=Qwen2-VL-72B, Bitwidth=W3A162024.12 | 59.6 | 77.6 | |
| Qwen2.5-Omni-7BModel Category=Perception-centric2026.03 | 59.2 | — | |
| VLAAModel Scale=7B2025.09 | 59.1 | — | |
| IWPToken Budget=35.3%, Backbone Model=Qwen2.5-VL-32B2026.04 | 58.9 | 94.2 | |
| Qwen2.5vl-InstructModel Scale=7B, Training Protocol=SFT + GRPO, Category=Open-Source Reasoning MLLMs2025.12 | 58.7 | — | |
| Qwen2.5-VL-32BToken Budget=100%, Backbone Model=Qwen2.5-VL-32B2026.04 | 58.7 | 100 | |
| V-ZeroBackbone=Qwen2.5-VL-7B-Instruct, Iteration=22026.01 | 58.6 | — | |
| Qwen2.5-VL-7BTraining=Base2026.03 | 58.6 | — | |
| Lumina-DiMOOModel Category=Unified2026.03 | 58.6 | — | |
| VisionZipToken Budget=35.3%, Backbone Model=Qwen2.5-VL-32B2026.04 | 58.6 | 94 | |
| Qwen2.5-VL-7BTraining=DF-GSPO2026.03 | 58.4 | — | |
| InternVL2-76BSize=76B2024.12 | 58.3 | — | |
| ICLABackbone=Qwen3-VL-8B2026.02 | 58.3 | — | |
| SCLBackbone=InternLM-XComposer-2-7B, Strategy=SCL2024.10 | 58.2 | — | |
| RTNModel=Qwen2-VL-72B, Bitwidth=W4A82024.12 | 58.1 | 73.2 | |
| R1-ShareVL-7B2026.03 | 58.1 | — | |
| Qwen2.5-VL-7BToken Retention Ratio=100%, Backbone=Qwen2.5-VL-7B2026.02 | 58 | — | |
| DoLABackbone=Qwen3-VL-8B2026.02 | 58 | — | |
| Qwen2.5-VL-7BModel Size=7B2026.02 | 58 | — | |
| Qwen2.5-VL-7BModel Category=MMU-Experts2026.03 | 58 | — | |
| SFTBackbone=InternLM-XComposer-2-7B, Strategy=SFT2024.10 | 57.95 | — | |
| VisionZipToken Budget=22.2%, Backbone Model=Qwen2.5-VL-32B2026.04 | 57.8 | 86.2 | |
| RTNModel=Qwen2-VL-72B, Bitwidth=W3A162024.12 | 57.7 | 75 | |
| MBQModel=Qwen2-VL-72B, Bitwidth=W4A82024.12 | 57.7 | 75.8 | |
| IWPToken Budget=22.2%, Backbone Model=Qwen2.5-VL-32B2026.04 | 57.7 | 89.6 | |
| V-R1Model Scale=7B2025.09 | 57.6 | — | |
| Qwen2.5vl-InstructModel Scale=7B, Category=Open-Source Reasoning MLLMs2025.12 | 57.4 | — | |
| Ovis2-8BModel Category=MMU-Experts2026.03 | 57.4 | — | |
| DivPruneToken Budget=35.3%, Backbone Model=Qwen2.5-VL-32B2026.04 | 57.4 | 93.4 | |
| GPTQModel=Qwen2-VL-72B, Bitwidth=W3A162024.12 | 57.3 | 76.6 | |
| DeCoBackbone=Qwen3-VL-8B2026.02 | 57.2 | — | |
| VanillaBackbone=Qwen3-VL-8B2026.02 | 57.1 | — | |
| VCDBackbone=Qwen3-VL-8B2026.02 | 57.1 | — | |
| FastVToken Budget=35.3%, Backbone Model=Qwen2.5-VL-32B2026.04 | 57.1 | 90.8 | |
| DAMOBackbone=Qwen3-VL-8B2026.02 | 56.9 | — | |
| MedVLThinker-7BModel Type=Medical LLM2025.10 | 56.86 | — | |
| GPT-4VLLM=Unk, Encoder=Unk, Resolution=Unk, Zero-shot=true2024.04 | 56.8 | — | |
| GPT4-VLLM Backbone=Unknown, Resolution=Unknown, PT=Unknown, IT=Unknown, Zero-shot=true2024.08 | 56.8 | — | |
| LLaVA-OneVisionModel Scale=72B, Category=Open-Source General MLLMs2025.12 | 56.8 | — | |
| GPT-4VCategory=Open-Source General MLLMs2025.12 | 56.8 | — | |
| LLaVA-OneVision-72B2025.06 | 56.8 | — | |
| VisionZipToken Budget=11.1%, Backbone Model=Qwen2.5-VL-32B2026.04 | 56.8 | 75.1 | |
| Qwen2.5-VL-7BTraining=GSPO2026.03 | 56.7 | — | |
| LLaVA-OV-72BSize=72B2024.12 | 56.6 | — | |
| VDDBackbone=Qwen3-VL-8B2026.02 | 56.5 | — | |
| InternLM-XComposer-2-7BBackbone=InternLM-XComposer-2-7B, Strategy=Base2024.10 | 56.48 | — | |
| CDPrunerToken Budget=35.3%, Backbone Model=Qwen2.5-VL-32B2026.04 | 56.4 | 87.2 | |
| InternVL2.5-8B-VisualPRMModel Scale=8B, Category=Open-Source Reasoning MLLMs2025.12 | 56.2 | — | |
| FP16Model=LLaVA-onevision-72B, Bitwidth=FP162024.12 | 56.1 | 74.3 | |
| CDPrunerToken Budget=22.2%, Backbone Model=Qwen2.5-VL-32B2026.04 | 56.1 | 81.3 | |
| SQModel=Qwen2-VL-72B, Bitwidth=W4A82024.12 | 55.9 | 72.2 | |
| MedVLSynther-7BModel Type=Medical LLM2025.10 | 55.88 | — | |
| MBQModel=LLaVA-onevision-72B, Bitwidth=W4A82024.12 | 55.6 | 70.8 | |
| FastVToken Budget=22.2%, Backbone Model=Qwen2.5-VL-32B2026.04 | 55.6 | 84 | |
| BAGELModel Category=Unified2026.03 | 55.3 | — | |
| LLaVANextData=LLaVANext-778k, LLM=Qwen2.5-32B2025.02 | 55.2 | — | |
| V-ZeroBackbone=Qwen2.5-VL-7B-Instruct, Iteration=12026.01 | 55.2 | — | |
| VILA1.5-40BSize=40B2024.12 | 55.1 | — | |
| Supervised GRPOBackbone=Qwen2.5-VL-7B-Instruct, Training Strategy=Supervised RL2026.01 | 55 | — | |
| RTNModel=LLaVA-onevision-72B, Bitwidth=W4A82024.12 | 54.8 | 70.7 | |
| DivPruneToken Budget=11.1%, Backbone Model=Qwen2.5-VL-32B2026.04 | 54.8 | 78.9 |