Multimodal Evaluation on LLaVA-bench in-the-wild
121.88ScoreSelf-Aug
Evaluation Results
| Method | Links | |
|---|---|---|
| Self-AugBackbone=Qwen3-VL-8B2025.10 | 121.88 | |
| VACoDeBackbone=Qwen3-VL-8B2025.10 | 121.06 | |
| VCDBackbone=Qwen3-VL-8B2025.10 | 119.76 | |
| MultinomialBackbone=Qwen3-VL-8B2025.10 | 118.5 | |
| MoE-LLaVA-2.7Bx4-Top2†LLM=Phi-2-2.7B, Activated Parameters=3.6B, Resolution=3842024.01 | 97.3 | |
| MoE-LLaVA-2.7Bx4-Top2LLM=Phi-2-2.7B, Activated Parameters=3.6B, Resolution=3362024.01 | 94.1 | |
| MoE-LLaVA-1.6Bx4-Top2†LLM=StableLM-1.6B, Activated Parameters=2.0B, Resolution=3842024.01 | 90.3 | |
| MoE-LLaVA-1.8Bx4-Top2LLM=Qwen-1.8B, Activated Parameters=2.2B, Resolution=3362024.01 | 88.7 | |
| MoE-LLaVA-1.6Bx4-Top2LLM=StableLM-1.6B, Activated Parameters=2.0B, Resolution=3362024.01 | 86.8 | |
| LLaVA-NeXT-8BLLM=Llama 3-8B, Resolution=6722024.08 | 80.1 | |
| VILA-13BModel Scale=13B, Precision=FP162023.06 | 78.3 | |
| LongVILA-7B (S3)LLM=Qwen2-7B, Resolution=dynamic2024.08 | 77.6 | |
| VILA-13B-AWQModel Scale=13B, Quantization=INT4-g1282023.06 | 77.6 | |
| Self-AugBackbone=LLaVA-1.5-13B2025.10 | 76.24 | |
| VILA-7B-AWQModel Scale=7B, Quantization=INT4-g1282023.06 | 75.8 | |
| VILA-7BModel Scale=7B, Precision=FP162023.06 | 75.2 | |
| VACoDeBackbone=LLaVA-1.5-13B2025.10 | 74.56 | |
| SliMELLM=Llama3-8B2024.11 | 73.9 | |
| VCDBackbone=LLaVA-1.5-13B2025.10 | 73.62 | |
| VILALLM=Llama 2-13B, Resolution=3362024.08 | 73 | |
| GroundingGPTLLM Size=7B2024.01 | 70.9 | |
| LLaVA-1.5LLM=Vicuna-1.5-13B, Resolution=3362024.08 | 70.7 | |
| LLaVA-1.5LLM=Vicuna-13B, Activated Parameters=13B, Resolution=3362024.01 | 70.7 | |
| LLaVA-1.5LLM=Llama3-8B2024.11 | 70.5 | |
| VILALLM=Llama 2-7B, Resolution=3362024.08 | 69.7 | |
| MultinomialBackbone=LLaVA-1.5-13B2025.10 | 69.48 | |
| Self-AugBackbone=LLaVA-1.5-7B2025.10 | 69.22 | |
| LLaVoltaStages=Three, Scheme=last stage compression, #Tokens=7848, Compression Ratio (CR)=235%, TFLOPS=5.47, Latency (ms)=52.2, Train Time=12.4h2024.06 | 69.2 | |
| VACoDeBackbone=LLaVA-1.5-7B2025.10 | 69.12 | |
| VCDBackbone=LLaVA-1.5-7B2025.10 | 69.08 | |
| LLaVoltaStages=Four, Scheme=deeper then wider, #Tokens=10863, Compression Ratio (CR)=170%, TFLOPS=8.26, Latency (ms)=68.5, Train Time=12.8h2024.06 | 68.2 | |
| Full-DataSampling Ratio=100% (665K), Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 67.9 | |
| LLaVoltaStages=Four, Scheme=wider then deeper, #Tokens=11088, Compression Ratio (CR)=166%, TFLOPS=8.26, Latency (ms)=68.5, Train Time=12.9h2024.06 | 67.7 | |
| LLaVoltaStages=Three, Scheme=compr. deeper, #Tokens=10597, Compression Ratio (CR)=174%, TFLOPS=8.26, Latency (ms)=68.5, Train Time=12.8h2024.06 | 67.5 | |
| LLaVoltaStages=Two, Scheme=compression, #Tokens=10062, Compression Ratio (CR)=183%, TFLOPS=8.26, Latency (ms)=68.5, Train Time=12.8h2024.06 | 67.3 | |
| CoIDOSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 66.7 | |
| Mini-Gemini (MGM-2B)#Tokens=18432, Compression Ratio (CR)=100%, Training Time=18.1h2024.06 | 65.9 | |
| OFASampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 65.8 | |
| LLaVolta (MGM-2B backbone)#Tokens=10863, Compression Ratio (CR)=170%, Training Time=14.8h2024.06 | 65.7 | |
| FocusLLaVALLM=Llama3-8B2024.11 | 65.6 | |
| PreSelSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 65.6 | |
| LLaVoltaStages=Single, Scheme=no compression, #Tokens=18432, Compression Ratio (CR)=-, TFLOPS=8.26, Latency (ms)=68.5, Train Time=15.3h2024.06 | 65.5 | |
| LLaVA-1.5LLM=Vicuna-7B2024.11 | 65.4 | |
| ICONSSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 65.3 | |
| TypiClustSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 65.2 | |
| COINCIDESampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 64.9 | |
| LLaVA-NeXTLLM=Llama3-8B, implementation=ours2024.11 | 64.7 | |
| LLaVoltaStages=Three, Scheme=compr. wider, #Tokens=10407, Compression Ratio (CR)=177%, TFLOPS=8.26, Latency (ms)=68.5, Train Time=12.8h2024.06 | 64.3 | |
| LLaVA-1.5LLM=Vicuna-1.5-7B, Resolution=3362024.08 | 63.4 | |
| LLaVA-1.5LLM=Vicuna-7B, Activated Parameters=6.7B, Resolution=3362024.01 | 63.4 | |
| LLaVA-1.5LLM Size=7B2024.01 | 63.4 | |
| XMASSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 62.4 | |
| IFDSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 62.3 | |
| CLIP-ScoreSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 61.3 | |
| Instruct-BLIPLLM=Vicuna-7B2024.11 | 60.9 | |
| InstructBLIPLLM=Vicuna-7B, Resolution=2242024.08 | 60.9 | |
| InstructBLIPLLM Size=7B2024.01 | 60.9 | |
| Self-FilterSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 60.6 | |
| EL2NSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 59 | |
| RandomSampling Ratio=15%, Backbone=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.05 | 58.8 | |
| TrimLLM=Vicuna-7B2024.11 | 58.7 | |
| MultinomialBackbone=LLaVA-1.5-7B2025.10 | 58.48 | |
| VCDBackbone=InstructBLIP2025.10 | 58.3 | |
| InstructBLIPLLM Size=13B2024.01 | 58.2 | |
| Self-AugBackbone=InstructBLIP2025.10 | 56.98 | |
| VACoDeBackbone=InstructBLIP2025.10 | 56.82 | |
| MultinomialBackbone=InstructBLIP2025.10 | 53.24 | |
| Self-AugBackbone=Qwen-VL2025.10 | 39.84 | |
| VACoDeBackbone=Qwen-VL2025.10 | 39.18 | |
| VCDBackbone=Qwen-VL2025.10 | 38.78 | |
| BLIP-2LLM=Vicuna-13B, Resolution=2242024.08 | 38.1 | |
| BLIP-2LLM Size=13B2024.01 | 38.1 | |
| MultinomialBackbone=Qwen-VL2025.10 | 35.98 |