Visual Question Answering on LLaVA-Bench-In-The-Wild
87.1ScoreMeteor
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Meteor2024.05 | 87.1 | — | |
| Meteor2024.05 | 87.1 | — | |
| ASMv22024.05 | 78.9 | — | |
| ASMv22024.05 | 78.9 | — | |
| SIMABase Model=VILA-7B2024.05 | 73.5 | — | |
| MoAI2024.05 | 71.9 | — | |
| MoAI2024.05 | 71.9 | — | |
| LLaVA-1.5-13B + MMFuserLLM=Vicuna-13B2024.10 | 71.8 | — | |
| GT-DPOBase Model=VILA-7B2024.05 | 71.4 | — | |
| LLaVA-1.5-13BLLM=Vicuna-13B2024.10 | 70.7 | — | |
| VILA-7BBase Model=VILA-7B2024.05 | 69.7 | — | |
| CoLLaVO2024.05 | 69.5 | — | |
| CoLLaVO2024.05 | 69.5 | — | |
| SIMABase Model=LLaVA-1.5-13B2024.05 | 67.4 | — | |
| GT-DPOBase Model=LLaVA-1.5-13B2024.05 | 66.9 | — | |
| LLaVA-1.5-13BBase Model=LLaVA-1.5-13B2024.05 | 66.5 | — | |
| SIMABase Model=LLaVA-1.5-7B2024.05 | 66.1 | — | |
| MLCDLLM=Qwen2-72B, Vision Tower=ViT-L/142024.07 | 66 | — | |
| LLaVA-1.5-7B + MMFuserLLM=Vicuna-7B2024.10 | 65.5 | — | |
| CLIPLLM=Qwen2-72B, Vision Tower=ViT-L/142024.07 | 65.41 | — | |
| POVIDBase Model=LLaVA-1.5-7B2024.05 | 65.3 | — | |
| GT-DPOBase Model=LLaVA-1.5-7B2024.05 | 64.7 | — | |
| HA-DPOBase Model=LLaVA-1.5-7B2024.05 | 64.2 | — | |
| RLHFBase Model=LLaVA-1.5-7B2024.05 | 63.7 | — | |
| LLaVA-1.5-7BLLM=Vicuna-7B2024.10 | 63.4 | — | |
| LLaVA-1.5-7BBase Model=LLaVA-1.5-7B2024.05 | 63.4 | — | |
| LLaVA-AlignedVQFine-tuned=No, Input=AlignedVQ features2024.11 | 62.7 | — | |
| LLaVA-Ori1+Fine-tuned=Yes (1 additional epoch), Input=Original images2024.11 | 61.6 | — | |
| LLaVA-OriFine-tuned=No, Input=Original images2024.11 | 61.1 | — | |
| LLaVA-JPEG-901+Fine-tuned=Yes (1 additional epoch), Input=JPEG images, JPEG quality=902024.11 | 61 | — | |
| InstructBLIPLLM=Vicuna-7B2024.10 | 60.9 | — | |
| LLaVA-JPEG-90Fine-tuned=No, Input=JPEG images, JPEG quality=902024.11 | 60.9 | — | |
| MLCDLLM=Qwen2-7B, Vision Tower=ViT-L/142024.07 | 58.9 | — | |
| CLIPLLM=Qwen2-7B, Vision Tower=ViT-L/142024.07 | 58.7 | — | |
| InstructBLIPLLM=Vicuna-13B2024.10 | 58.2 | — | |
| LLaVA-JPEG-10Fine-tuned=No, Input=JPEG images, JPEG quality=102024.11 | 54.3 | — | |
| LLaVA-JPEG-101+Fine-tuned=Yes (1 additional epoch), Input=JPEG images, JPEG quality=102024.11 | 51.5 | — | |
| BLIP-2LLM=Vicuna-13B2024.10 | 38.1 | — | |
| BLIP-22024.05 | — | 38.1 | |
| IDEFICS2024.05 | — | 45 | |
| InstructBLIP2024.05 | — | 60.9 | |
| LLaVA-1.5-7BSIMA=false2024.05 | — | 63.4 | |
| LLaVA-1.5-7BSIMA=true2024.05 | — | 66.1 | |
| mPLUG-Owl22024.05 | — | 59.9 | |
| Qwen-VL-Chat2024.05 | — | 67.7 | |
| VILA-7BSIMA=false2024.05 | — | 69.7 | |
| VILA-7BSIMA=true2024.05 | — | 73.5 |