LLaVA-Bench
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
LLaVA-Bench
93.1Conversation Score
11
LLaVA-Bench
59.4CHAIRs
10
LLaVA-Bench LLaVAW
89.1Score
10
LLaVA-Bench in-the-wild
49.3Average Score
9
LLaVA-Bench In-the-Wild (test)
34.3ROUGE-L
8
LLaVA-Bench
96.6Score
8
LLaVA-Bench Tool Use (test)
0.893Grounding
8
LLaVA-Bench Tool Use
89.3Grounding
8
LLaVA-Bench In-the-Wild (full)
90.1Reasoning Score
8
LLaVA-Bench
106.8Overall Accuracy
7
LLaVA-Bench (LLaVA-B)
77.5Score
7
LLaVA Bench v1 (test)
37.18Relevance
7
LLaVA-Bench In-the-Wild v1 (test)
0.726General Score
7
LLaVA-Bench In-the-Wild
5.833Accuracy
6
LLaVA-Bench
6.52Accuracy
6
LLaVA-Bench (test)
70.3Complex Accuracy
6
LLaVA-Bench GPT-4V-aided (full)
6.96Accuracy
6
LLaVA-Bench Natural QA
74.5Score
6
LLaVA-Bench 100 images (test)
6.53Accuracy
6
LLaVA-Bench
63.4LLaVA^W
6
LLaVA-Bench COCO (test)
85.4Conversation
6
LLaVA-Bench In-the-Wild v1
65.5Conversational Score
6
LLaVA-Bench COCO v1
0.82Conv Score
6
LLaVA-Bench v1 (test)
74.2Score
6
LLaVA-Bench In-the-Wild
7.88Utility Score
4