General Reasoning on MMMU
85.4Overall ScoreGPT5
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT5Model Category=Proprietary Model2026.07 | 85.4 | |
| Gemini-2.5-ProModel Category=Proprietary Model2026.07 | 84 | |
| ViLoMemBackbone=InternVL-3.5-8B, Augmentation=ViLoMem2026.01 | 75.4 | |
| InternVL-3.5-8BBackbone=InternVL-3.5-8B, Augmentation=None2026.01 | 74.7 | |
| PolarMemBackbone=InternVL-3.5-8B, Augmentation=PolarMem2026.01 | 74.1 | |
| Vanilla RAGBackbone=InternVL-3.5-8B, Augmentation=Vanilla RAG2026.01 | 73.4 | |
| ViLoMemBackbone=QWEN2.5-VL-32B, Augmentation=ViLoMem2026.01 | 69.1 | |
| QWEN2.5-VL-32BBackbone=QWEN2.5-VL-32B, Augmentation=None2026.01 | 68.4 | |
| Vanilla RAGBackbone=QWEN2.5-VL-32B, Augmentation=Vanilla RAG2026.01 | 67.2 | |
| ViLoMemBackbone=InternVL-3.5-4B, Augmentation=ViLoMem2026.01 | 67 | |
| PolarMemBackbone=QWEN2.5-VL-32B, Augmentation=PolarMem2026.01 | 66.5 | |
| InternVL-3.5-4BBackbone=InternVL-3.5-4B, Augmentation=None2026.01 | 66.5 | |
| PolarMemBackbone=InternVL-3.5-4B, Augmentation=PolarMem2026.01 | 65.5 | |
| Vanilla RAGBackbone=InternVL-3.5-4B, Augmentation=Vanilla RAG2026.01 | 64.7 | |
| LoMoModel=Qwen3.5-9B, Evaluation Protocol=Standard Evaluation2026.05 | 63 | |
| LoMoModel=Qwen3.5-9B, Evaluation Protocol=Rendered Evaluation2026.05 | 62.48 | |
| LASERModel Category=Open-source Vision-Language Model2026.07 | 62.1 | |
| Reflection-V-7BModel Category=Open-source Vision-Language Model2026.07 | 61.3 | |
| VAPO-Thinker-7BModel Category=Open-source Vision-Language Model2026.07 | 60.2 | |
| Standard SFTModel=Qwen3.5-9B, Evaluation Protocol=Standard Evaluation2026.05 | 59.44 | |
| ViLoMemBackbone=QWEN2.5-VL-7B, Augmentation=ViLoMem2026.01 | 58.6 | |
| VisionR1-7BModel Category=Open-source Vision-Language Model2026.07 | 57.6 | |
| QWEN2.5-VL-7BBackbone=QWEN2.5-VL-7B, Augmentation=None2026.01 | 56.3 | |
| PolarMemBackbone=QWEN2.5-VL-7B, Augmentation=PolarMem2026.01 | 55.7 | |
| Vanilla RAGBackbone=QWEN2.5-VL-7B, Augmentation=Vanilla RAG2026.01 | 55.4 | |
| R1-Onevision-7BModel Category=Open-source Vision-Language Model2026.07 | 54.3 | |
| ViLoMemBackbone=DeepSeek-VL2, Augmentation=ViLoMem2026.01 | 54 | |
| Qwen2.5-VL-7BModel Category=Open-source Vision-Language Model2026.07 | 52.7 | |
| VLAA-Thinker-7B2026.05 | 52.1 | |
| EvoLMM2026.05 | 51.9 | |
| DUELRole=Solver2026.05 | 51.9 | |
| OpenVLThinker-7B2026.05 | 51.8 | |
| Standard SFTModel=LLaVA-OV1.5-8B, Evaluation Protocol=Standard Evaluation2026.05 | 51.78 | |
| Vision-Zero(CLEVR)2026.05 | 51.7 | |
| MM-UPT2026.05 | 51.5 | |
| DUELRole=Challenger2026.05 | 51.4 | |
| LoMoModel=LLaVA-OV1.5-8B, Evaluation Protocol=Standard Evaluation2026.05 | 51.22 | |
| Qwen2.5-VL-7B2026.05 | 51.2 | |
| DeepSeek-VL2Backbone=DeepSeek-VL2, Augmentation=None2026.01 | 51.1 | |
| ViLoMemBackbone=LLaVA-Next-Llama-3-8B, Augmentation=ViLoMem2026.01 | 51 | |
| ViLoMemBackbone=DeepSeek-VL2-Small, Augmentation=ViLoMem2026.01 | 50.8 | |
| Vanilla RAGBackbone=DeepSeek-VL2, Augmentation=Vanilla RAG2026.01 | 50.6 | |
| PolarMemBackbone=DeepSeek-VL2, Augmentation=PolarMem2026.01 | 50.4 | |
| Standard SFTModel=Qwen3.5-9B, Evaluation Protocol=Rendered Evaluation2026.05 | 49.52 | |
| PolarMemBackbone=LLaVA-Next-Llama-3-8B, Augmentation=PolarMem2026.01 | 49.1 | |
| Vanilla RAGBackbone=DeepSeek-VL2-Small, Augmentation=Vanilla RAG2026.01 | 49 | |
| InternVL2.5-8BModel Category=Open-source Vision-Language Model2026.07 | 49 | |
| LLaVA-Next-Llama-3-8BBackbone=LLaVA-Next-Llama-3-8B, Augmentation=None2026.01 | 48.8 | |
| PolarMemBackbone=LLaVA-Next-Mistral-7B, Augmentation=PolarMem2026.01 | 48.6 | |
| DeepSeek-VL2-SmallBackbone=DeepSeek-VL2-Small, Augmentation=None2026.01 | 48.3 | |
| Vanilla RAGBackbone=LLaVA-Next-Llama-3-8B, Augmentation=Vanilla RAG2026.01 | 48 | |
| ViLoMemBackbone=LLaVA-Next-Mistral-7B, Augmentation=ViLoMem2026.01 | 47.8 | |
| PolarMemBackbone=DeepSeek-VL2-Small, Augmentation=PolarMem2026.01 | 47.6 | |
| LLaVA-Next-Mistral-7BBackbone=LLaVA-Next-Mistral-7B, Augmentation=None2026.01 | 46.3 | |
| Vanilla RAGBackbone=LLaVA-Next-Mistral-7B, Augmentation=Vanilla RAG2026.01 | 45.4 | |
| LoMoModel=LLaVA-OV1.5-8B, Evaluation Protocol=Rendered Evaluation2026.05 | 35.56 | |
| Standard SFTModel=LLaVA-OV1.5-8B, Evaluation Protocol=Rendered Evaluation2026.05 | 21.22 |