Multimodal Evaluation on LLaVA-Bench-Wild (LLaVA-W)
97.3Overall ScoreMoE-LLaVA
Evaluation Results
| Method | Links | |
|---|---|---|
| MoE-LLaVALLM=Phi2-2.7B, Size=3.9B, Res.=3842024.02 | 97.3 | |
| MoE-LLaVALLM=Phi2-2.7B, Size=3.9B, Res.=3362024.02 | 94.1 | |
| VILA-13B + ShareGPT4VLLM=Llama-2-13B, Resolution=336, Pre-training samples=50M, Instruction tuning samples=1M2023.12 | 78.4 | |
| TinyLLaVA-share-Sig-PhiLLM=Phi2-2.7B, Size=3.1B, Res.=3842024.02 | 75.8 | |
| VILA-13BLLM=Llama-2-13B, Resolution=336, Pre-training samples=50M, Instruction tuning samples=1M2023.12 | 73 | |
| LLaVA-1.5LLM=Vicuna-1.5-13B, Resolution=336, Pre-training samples=0.6M, Instruction tuning samples=0.7M2023.12 | 70.7 | |
| VILA-7BLLM=Llama-2-7B, Resolution=336, Pre-training samples=50M, Instruction tuning samples=1M2023.12 | 69.7 | |
| Full-FinetuneTarget Model=LLaVA-1.5-13B, Data Budget=100%2026.05 | 69.5 | |
| Self-FilterTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 69.1 | |
| MAGICTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 69 | |
| PerplexityTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 68.7 | |
| SemDedupTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 68.7 | |
| RandomTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 68.6 | |
| CLIP-ScoreTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 68.1 | |
| COINCIDETarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 67.4 | |
| TinyLLaVA-share-C-PhiLLM=Phi2-2.7B, Size=3.0B, Res.=3362024.02 | 67.1 | |
| D2-PruningTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 66.5 | |
| PADEintervention strength λ=0.12026.02 | 65.92 | |
| EL2NTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 65.8 | |
| V-ITI2026.02 | 65.44 | |
| TrustLLaVALLM=Vicuna-7B, Resolution=3362026.07 | 65.3 | |
| Self-SupTarget Model=LLaVA-1.5-13B, Data Budget=20%2026.05 | 64.9 | |
| Vanilla2026.02 | 64.8 | |
| OPERA2026.02 | 64.31 | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution=3362026.07 | 64.2 | |
| HyperLLaVALLM=Vicuna-7B, Res.=336, PT=558K, IT=665K2024.03 | 64 | |
| HyperLLaVA w/o EvLLM=Vicuna-7B, Res.=336, PT=558K, IT=665K2024.03 | 63.7 | |
| LLaVA-1.5LLM=V-7B, Size=7B, Res.=3362024.02 | 63.4 | |
| LLaVA-1.5LLM=Vicuna-7B, Res.=336, PT=558K, IT=665K2024.03 | 63.4 | |
| LLaVA-1.5LLM=Vicuna-1.5-7B, Resolution=336, Pre-training samples=0.6M, Instruction tuning samples=0.7M2023.12 | 63.4 | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution=3362026.07 | 63.4 | |
| Full-FinetuneDataset=Vision-Flan-186K, #Data=186k2026.05 | 63.3 | |
| VCD2026.02 | 63.21 | |
| MAGICDataset=Vision-Flan-186K, #Data=∼37k2026.05 | 63.2 | |
| HyperLLaVA w/o ELLLM=Vicuna-7B, Res.=336, PT=558K, IT=665K2024.03 | 62.6 | |
| INTER2026.02 | 61.7 | |
| LLaVA-SPLLM=Vicuna-7B, Resolution=3362026.07 | 61.7 | |
| InstructBLIPLLM=V-7B, Size=8.2B, Res.=2242024.02 | 60.9 | |
| InstructBLIPLLM=Vicuna-7B, Resolution=224, Pre-training samples=129M, Instruction tuning samples=1.2M2023.12 | 60.9 | |
| RandomDataset=Vision-Flan-186K, #Data=∼37k2026.05 | 58.7 | |
| ICD2026.02 | 56.9 | |
| TrustLLaVA (MLP)LLM=Vicuna-7B, Resolution=3362026.07 | 51.5 | |
| BLIP-2LLM=Vicuna-13B, Resolution=224, Pre-training samples=129M, Instruction tuning samples=null2023.12 | 38.1 |