LLaVA
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
LLaVA Evaluation Suite 1.5
101.15Average Score
127
LLaVA LLM Pre-training
0.688AUC
88
LLaVA Evaluation Suite 7B v1.5 (test)
61.9GQA
59
LLaVA-W
49.1ROUGE-L
56
LLaVA Multi-modal Evaluation Suite (GQA, MMB, MME, POPE, SQA, VQAv2, TextVQA, MMMU, SEED-I) v1.6 (test)
100Average Score
53
LLaVA VLLM Tuning
0.993AUC
44
LLaVA Evaluation Suite GQA, MMB, MMB-CN, MME, POPE, SQA, VQAV2, VQAText, VizWiz
64.2GQA
41
LLaVA Multimodal Evaluation Suite (GQA, MMBench, MME, POPE, ScienceQA, VQAv2, TextVQA, SEED-Bench, MM-Vet, VizWiz) 1.5 (test/val)
62GQA
41
Aggregate LLaVA 1.5 Suite
100Relative Average Score
39
LLaVA v1.5
3.18ASR
36
LLaVA v1.5
22.35Toxicity Score
36
LLaVA-OneVision
66.82Score
36
LLaVA Evaluation Suite (GQA, SQA-IMG, VQA-Text, POPE, MME, MMBench-EN, MMBench-CN, MM-Vet) 1.5
61.9GQA Accuracy
28
LLaVA-W
102Score
28
LLaVA-1.5-7B Evaluation Suite (GQA, MMBench, MMBench-CN, MME, POPE, ScienceQA, TextVQA, VizWiz, MM-Vet)
61.9GQA Score
25
LLaVA 7B Evaluation Suite (GQA, MMBench, MMBench-CN, MME, POPE, ScienceQA, VQAv2, TextVQA, SEED-Bench, VizWiz) 1.5
61.9GQA Accuracy
22
LLaVA 13B 1.5 (test)
60.2TTFT (ms)
21
llava
96.5AUC ROC
19
LLaVA High-IC tasks (MMB, POPE, MME, SEED, GQA) 1.5-7B
94.7Performance Ratio
18
LLaVA-QA90 (test)
6.69Accuracy
18
LLaVA-Wild
69.8Average Score
17
LLaVA Evaluation Suite (GQA, MME, POPE, SQA-Img, VizWiz, VQAv2, MMB-En) 1.5
61.9GQA
16
LLaVA Evaluation Suite (MMBench, MME, MM-Vet, ScienceQA) 1.5 (test val)
68.5MMBench
16
LLaVA 665K Evaluation Suite
100.3Relative Score
15
LLaVA Vicuna-7B v1.6
92Accuracy
13