Vision-Language Evaluation Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Vision-Language Evaluation Suite (MMB, POPE, ScienceQA-Image, TextVQA, GQA, MM-Vet) (test)
69.56MMB Score
10
Vision-Language Evaluation Suite MMB, MMStar, MMMU, Hallusion, AI2D, OCR, SEED, SQA (test val)
80.7MMB Score
10
Vision-Language Evaluation Suite (ChartQA, DocVQA, AI2D, VQA, AndroidControl, CountBenchQA)
68.1ChartQA Accuracy
2