Visual Instruction Following on LLaVA-Bench Wild
102.3ScoreAutoV
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AutoVBackbone=Qwen2.5-VL 7B2025.06 | 102.3 | — | |
| APIBackbone=Qwen2.5-VL 7B2025.06 | 100.6 | — | |
| FGVPBackbone=Qwen2.5-VL 7B2025.06 | 98.2 | — | |
| BaseBackbone=Qwen2.5-VL 7B2025.06 | 98 | — | |
| CircleBackbone=Qwen2.5-VL 7B2025.06 | 97.5 | — | |
| AutoVBackbone=LLaVA-OneVision 7B2025.06 | 85.3 | — | |
| APIBackbone=LLaVA-OneVision 7B2025.06 | 81.9 | — | |
| InternLM-XComposer2LLM=InternLM2-7B2024.01 | 81.8 | — | |
| CircleBackbone=LLaVA-OneVision 7B2025.06 | 80.8 | — | |
| BaseBackbone=LLaVA-OneVision 7B2025.06 | 80.6 | — | |
| AutoVBackbone=InternVL2 8B2025.06 | 79.5 | — | |
| LyricsShot=1-shot2023.12 | 79.1 | — | |
| LyricsShot=4-shot2023.12 | 78.6 | — | |
| LyricsShot=0-shot2023.12 | 76.9 | — | |
| VILA1.5-3BModel Size=3B2024.09 | 76.7 | — | |
| TroL-3.8BModel Size=3.8B2024.09 | 76.6 | — | |
| Phantom-3.8BModel Size=3.8B2024.09 | 76.2 | — | |
| APIBackbone=InternVL2 8B2025.06 | 76.2 | — | |
| FGVPBackbone=InternVL2 8B2025.06 | 75.7 | — | |
| CircleBackbone=InternVL2 8B2025.06 | 75.4 | — | |
| BaseBackbone=InternVL2 8B2025.06 | 74.6 | — | |
| LLaVA1.5-BPOParameters=13B2024.03 | 74.4 | — | |
| LLaVA-OneVision-0.5BModel Size=0.5B2024.09 | 74.2 | — | |
| CogVLM-17BLLM=Vicuna-7B2024.01 | 73.9 | — | |
| ShareGPT4VLLM=Vicuna-7B2024.01 | 72.6 | — | |
| LLaVA-v1.5-13BModel scale=13B, Number of vision tokens=5762025.08 | 72.5 | — | |
| LLaVA1.5-BPOParameters=7B2024.03 | 71.6 | — | |
| LLaVA1.5Parameters=13B2024.03 | 71.2 | — | |
| FGVPBackbone=LLaVA-OneVision 7B2025.06 | 70.8 | — | |
| LLaVA-1.5LLM=Vicuna-13B2024.01 | 70.7 | — | |
| TroL-1.8BModel Size=1.8B2024.09 | 69.7 | — | |
| Phantom-0.5BModel Size=0.5B2024.09 | 69.6 | — | |
| AutoVBackbone=LLaVA-1.5 13B2025.06 | 69.5 | — | |
| Fourier-LLaVAModel scale=13B, Number of vision tokens=144, Compression ratio=75.0%2025.08 | 69.5 | — | |
| Qwen-VLShot=4-shot2023.12 | 68.6 | — | |
| Phantom-1.8BModel Size=1.8B2024.09 | 68.6 | — | |
| AutoVBackbone=LLaVA-1.5 7B2025.06 | 68.6 | — | |
| Qwen-VLShot=1-shot2023.12 | 68.2 | — | |
| Fourier-LLaVAModel scale=7B, Number of vision tokens=144, Compression ratio=75.0%2025.08 | 67.8 | — | |
| Qwen-VL-ChatLLM=Qwen-7B2024.01 | 67.7 | — | |
| Qwen-VLShot=0-shot2023.12 | 67.7 | — | |
| APIBackbone=LLaVA-1.5 13B2025.06 | 67.6 | — | |
| LLaVAParameters=13B2024.03 | 67.3 | — | |
| APIBackbone=LLaVA-1.5 7B2025.06 | 67.2 | — | |
| CircleBackbone=LLaVA-1.5 13B2025.06 | 66.9 | — | |
| BaseBackbone=LLaVA-1.5 13B2025.06 | 66.6 | — | |
| BaseBackbone=LLaVA-1.5 7B2025.06 | 65.4 | — | |
| LLaVA-v1.5-7BModel scale=7B, Number of vision tokens=5762025.08 | 65.4 | — | |
| MQT-LLaVAModel scale=7B, Number of vision tokens=256, Compression ratio=55.6%2025.08 | 64.6 | — | |
| Fourier-LLaVAModel scale=7B, Number of vision tokens=256, Compression ratio=55.6%2025.08 | 64.4 | — | |
| LLaVA1.5Parameters=7B2024.03 | 63.8 | — | |
| LLaVA-XTunerLLM=InternLM2-20B2024.01 | 63.7 | — | |
| FGVPBackbone=LLaVA-1.5 13B2025.06 | 63.7 | — | |
| Fourier-LLaVAModel scale=7B, Number of vision tokens=64, Compression ratio=88.9%2025.08 | 63.1 | — | |
| LLaVALLM=Vicuna-7B2024.01 | 63 | — | |
| CircleBackbone=LLaVA-1.5 7B2025.06 | 62.2 | — | |
| MQT-LLaVAModel scale=7B, Number of vision tokens=144, Compression ratio=75.0%2025.08 | 61.4 | — | |
| Fourier-LLaVAModel scale=7B, Number of vision tokens=36, Compression ratio=93.75%2025.08 | 61.1 | — | |
| InstructBLIPLLM=Vicuna-7B2024.01 | 60.9 | — | |
| MQT-LLaVAModel scale=7B, Number of vision tokens=36, Compression ratio=93.75%2025.08 | 59.6 | — | |
| MQT-LLaVAModel scale=7B, Number of vision tokens=64, Compression ratio=88.9%2025.08 | 59.4 | — | |
| InstructBLIPParameters=14B2024.03 | 58.2 | — | |
| IDEFICS-80BLLM=LLaMA-65B2024.01 | 56.9 | — | |
| FGVPBackbone=LLaVA-1.5 7B2025.06 | 55.6 | — | |
| InternLM-XCLLM=InternLM-7B2024.01 | 53.8 | — | |
| BLIP2Shot=4-shot2023.12 | 43.3 | — | |
| BLIP2Shot=1-shot2023.12 | 40.6 | — | |
| BLIP-2LLM=FLAN-T52024.01 | 38.1 | — | |
| BLIP-2Parameters=12B2024.03 | 38.1 | — | |
| BLIP2Shot=0-shot2023.12 | 38.1 | — | |
| Monkey-10BLLM=Qwen-7B2024.01 | 33.5 | — | |
| BLIP-2LLM Backbone=Vicuna-13B, Resolution=224, PT=129M, IT=Unknown, Zero-shot=true2024.08 | — | 38.1 | |
| BLIVALLM Backbone=Vicuna-7B, Resolution=224, PT=558K, IT=1.2M, Zero-shot=true2024.08 | — | 80.1 | |
| CROMELLM Backbone=Vicuna-7B, Resolution=224, PT=558K, IT=8M, Zero-shot=true2024.08 | — | 79.2 | |
| CROMELLM Backbone=Vicuna-13B, Resolution=224, PT=558K, IT=8M, Zero-shot=true2024.08 | — | 86.8 | |
| CROMELLM Backbone=Flan-T5 XXL, Resolution=224, PT=558K, IT=8M, Zero-shot=true2024.08 | — | 76.4 | |
| Gemini Pro VisionLLM Backbone=Unknown, Resolution=Unknown, PT=Unknown, IT=Unknown, Zero-shot=true2024.08 | — | 79.9 | |
| GPT4-VLLM Backbone=Unknown, Resolution=Unknown, PT=Unknown, IT=Unknown, Zero-shot=true2024.08 | — | 69.1 | |
| InstructBLIPLLM Backbone=Vicuna-7B, Resolution=224, PT=129M, IT=1.2M, Zero-shot=true2024.08 | — | 60.9 | |
| InstructBLIPLLM Backbone=Vicuna-13B, Resolution=224, PT=129M, IT=1.2M, Zero-shot=true2024.08 | — | 58.2 | |
| LLaVA-1.5LLM Backbone=Vicuna-7B, Resolution=336, PT=558K, IT=665K, Zero-shot=true2024.08 | — | 63.4 | |
| LLaVA-1.5LLM Backbone=Vicuna-13B, Resolution=336, PT=558K, IT=665K, Zero-shot=true2024.08 | — | 70.7 | |
| LLaVA-1.6LLM Backbone=Vicuna-7B, Resolution=336, PT=558K, IT=760K, Zero-shot=true2024.08 | — | 81.6 | |
| LLaVA-1.6LLM Backbone=Vicuna-13B, Resolution=336, PT=558K, IT=760K, Zero-shot=true2024.08 | — | 87.3 | |
| Qwen VL-PlusLLM Backbone=Unknown, Resolution=Unknown, PT=Unknown, IT=Unknown, Zero-shot=true2024.08 | — | 73.3 |