Multimodal Understanding on MMMU-Pro std.
61.3AccuracyGPT-5 Nano
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5 NanoRL=N/A, Initial Model=N/A2026.04 | 61.3 | |
| Q3VL 8B-ThkRL=N/A, Initial Model=N/A2026.04 | 60.4 | |
| Vero Q3I-8BRL=Qwen3VL, Initial Model=8B Inst2026.04 | 59.8 | |
| Vero Q3T-8BRL=Qwen3VL, Initial Model=8B Think2026.04 | 59.5 | |
| MiMoVL 7B-RLRL=MiMoVL, Initial Model=7B-SFT2026.04 | 59.4 | |
| Vero Mi-7BRL=MiMoVL, Initial Model=7B-SFT2026.04 | 58.9 | |
| Claude 3.7 SonnetParams=–2025.11 | 56.5 | |
| Q3VL 8B-InsRL=N/A, Initial Model=N/A2026.04 | 55.9 | |
| MiMo-EmbodiedParams=7B2025.11 | 52.08 | |
| InternVL3Params=8B2025.11 | 45.6 | |
| Vero Q25-7BRL=Qwen25VL, Initial Model=7B Inst2026.04 | 43.5 | |
| GPT-4oParams=–2025.11 | 42.5 | |
| MiMo-VLParams=7B2025.11 | 42.37 | |
| VL-RethinkerRL=Q25VL, Initial Model=7B-Ins2026.04 | 41.7 | |
| LLaVA OV1.5-RLRL=LLaVA, Initial Model=OV1.5-Ins2026.04 | 39.9 | |
| Q25VL 7B-InsRL=N/A, Initial Model=N/A2026.04 | 38.3 | |
| DiffusionVLSize=7B, Type=Diff., Samples=738K2025.12 | 36.9 | |
| Qwen2.5VLSize=7B, Type=AR, Samples=>9M2025.12 | 36.7 | |
| LLaDA-VSize=8B, Type=Diff., Samples=16.5M2025.12 | 35.2 | |
| Qwen2.5-VLParams=7B2025.11 | 34.7 | |
| Mo2-O 7BRL=SFT Only, Initial Model=N/A2026.04 | 31.9 | |
| Qwen2.5VLSize=3B, Type=AR, Samples=>9M2025.12 | 31.2 | |
| DiffusionVLSize=3B, Type=Diff., Samples=738K2025.12 | 31.2 | |
| LaViDa-LSize=8B, Type=Diff., Samples=1.6M2025.12 | 28.6 |