MLLM Evaluation Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
MLLM Evaluation Suite GQA, ScienceQA-IMG, TextVQA, POPE, MME, MMBench, MM-Vet, MMStar, AI2D, HallusionBench (test val)
100.6Relative Accuracy (%)
56
MLLM Evaluation Suite (HallusionBench, MME, AI2D, RWQA, SQA, POPE, MMBench, CCB, VSR, V7W) (test)
62.93HallusionBench Score
32
MLLM Evaluation Suite
56.7Average Score (All)
22
MLLM Evaluation Suite GQA MME POPE SQA VQAtext VizWiz MMBen AI2D v1.5 v1.6 Qwen2.5 (test)
64.8GQA Score
12
MLLM Evaluation Suite (GQA, MMB, MMB-CN, MME, POPE, SQA, VQAv2, VQA-Text, VizWiz) (test)
64.27GQA Accuracy
11
MLLM Evaluation Suite (HallBench, MME, TextVQA, ChartQA, AI2D, RealWorldQA, CCBench, OCRVQA, SQA-IMG, POPE) (test)
49.8HallBench
7
MLLM Evaluation Suite (GQA, MMBench, MME, POPE, ScienceQA, VQA v2, HRBench-8k, XLRS)
60.9GQA Score
7
MLLM Evaluation Suite (GQA, MMBench, MME, POPE, ScienceQA, VQAv2, MMMU, SEED-I) LLaVA-NeXT (test)
64.2GQA Accuracy
7
MLLM Evaluation Suite (MME, MMB, VizWiz, POPE, GQA, RQA, VQAT, SQA) standard (test val)
2,375MME Score
5
MLLM Evaluation Suite (GQA, MMB, MME, POPE, SQA, VQAv2, VQAText, MMMU, SEED-I, VizWiz)
65.4GQA Score
4
MLLM Evaluation Suite (MME, MMStar, SQA, RealWorldQA, MMMU, MMMU-P, VisuLogic, LogicVista, CRPE, POPE, HallBench) (test)
74.94MME
4