Professional Multimodal Understanding on MMMU-Pro
14.98ECEGPT-4o
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-4oConf.=Token Confidence, Source=Closed-source MLLMs2026.04 | 14.98 | 70.53 | 64.77 | 43.97 | |
| GPT-4o-miniConf.=Token Confidence, Source=Closed-source MLLMs2026.04 | 18.56 | 67.41 | 59.88 | 38.8 | |
| GPT-4o-miniConf.=Verbal Confidence, Source=Closed-source MLLMs2026.04 | 19.19 | 65.43 | 49.78 | 23.4 | |
| Phi-3.5-VisionConf.=Token Confidence, Source=Open-source MLLMs2026.04 | 21.01 | 55.51 | 53.64 | 9.16 | |
| MiniCPM-V-2.6Conf.=Token Confidence, Source=Open-source MLLMs2026.04 | 26.48 | 44.23 | 33.89 | -5.05 | |
| Phi-3.5-VisionConf.=Verbal Confidence, Source=Open-source MLLMs2026.04 | 28.2 | 67.42 | 69.02 | 39.31 | |
| InternVL2.5-4BConf.=Verbal Confidence, Source=Open-source MLLMs2026.04 | 28.44 | 77.71 | 74.17 | 44.43 | |
| GPT-4oConf.=Verbal Confidence, Source=Closed-source MLLMs2026.04 | 30.91 | 70.78 | 57.48 | 32.36 | |
| Qwen2.5-VL-7BConf.=Token Confidence, Source=Open-source MLLMs2026.04 | 35.52 | 56.65 | 32.14 | 11.26 | |
| MiniCPM-V-2.6Conf.=Verbal Confidence, Source=Open-source MLLMs2026.04 | 37.19 | 58.01 | 49.51 | 19.77 | |
| InternVL2.5-4BConf.=Token Confidence, Source=Open-source MLLMs2026.04 | 39.49 | 31.64 | 43 | -22.66 | |
| InternVL3.5-8BConf.=Verbal Confidence, Source=Open-source MLLMs2026.04 | 41.91 | 70.4 | 46.5 | 25.04 | |
| Qwen2.5-VL-7BConf.=Verbal Confidence, Source=Open-source MLLMs2026.04 | 47.68 | 71.99 | 33.76 | 13.38 | |
| InternVL3.5-8BConf.=Token Confidence, Source=Open-source MLLMs2026.04 | 51.36 | 50.29 | 28.58 | -0.08 |