Multimodal Understanding on MMMU-Pro vision
45.84AccuracyMiMo-Embodied
Evaluation Results
| Method | Links | |
|---|---|---|
| MiMo-EmbodiedParams=7B2025.11 | 45.84 | |
| Claude 3.7 SonnetParams=–2025.11 | 45.8 | |
| Perception-R1-7BBase Model Family=Qwen2.5-VL2025.06 | 40.3 | |
| InternVL3Params=8B2025.11 | 37.8 | |
| SophiaVL-R1-7BBase Model Family=Qwen2.5-VL2025.06 | 37.6 | |
| Qwen2.5-VL-7B-IT + GRPOBase Model Family=Qwen2.5-VL, Instruction-Tuning=IT, Training Strategy=GRPO2025.06 | 37.1 | |
| GPT-4oParams=–2025.11 | 36.1 | |
| Vision-R1-7BBase Model Family=Qwen2.5-VL2025.06 | 36 | |
| MiMo-VLParams=7B2025.11 | 35.95 | |
| OpenVLThinker-7BBase Model Family=Qwen2.5-VL2025.06 | 35.3 | |
| MM-Eureka-7BBase Model Family=Qwen2.5-VL2025.06 | 35.2 | |
| VLAA-Thinker-7BBase Model Family=Qwen2.5-VL2025.06 | 34.8 | |
| Qwen2.5-VL-7B-ITBase Model Family=Qwen2.5-VL, Instruction-Tuning=IT2025.06 | 33.8 | |
| Perception-R1-Qwen2-7BBase Model Family=Qwen2-VL2025.06 | 33.7 | |
| R1-Onevision-7BBase Model Family=Qwen2.5-VL2025.06 | 30.7 | |
| Qwen2-VL-7B-IT + GRPOBase Model Family=Qwen2-VL, Instruction-Tuning=IT, Training Strategy=GRPO2025.06 | 29.8 | |
| Qwen2.5-VLParams=7B2025.11 | 29.4 | |
| Qwen2-VL-7B-ITBase Model Family=Qwen2-VL, Instruction-Tuning=IT2025.06 | 26.6 | |
| R1-VL-7BBase Model Family=Qwen2-VL2025.06 | 23.6 |