Multimodal Conversation on LLaVA-Bench Wild
102ScoreGPT-4o-0513
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o-05132024.09 | 102 | |
| Gemini-1.5-Pro2024.09 | 95.3 | |
| LocoREBackbone=Qwen2.5-VL, Model Size=32B, Inference Strategy=LocoRE2026.01 | 82.7 | |
| Cambrian-34B2024.09 | 82 | |
| Qwen2.5-VL-32BBackbone=Qwen2.5-VL, Model Size=32B, Inference Strategy=Base2026.01 | 81.2 | |
| Claude3.5-Sonnet2024.09 | 81 | |
| OneVision2024.09 | 81 | |
| SGRS + LocoREBackbone=Qwen2.5-VL, Model Size=7B, Inference Strategy=SGRS + LocoRE2026.01 | 80 | |
| Ovis1.5-LLAMA3-8B2024.09 | 79.9 | |
| SGRS + LocoREBackbone=Qwen2-VL, Model Size=7B, Inference Strategy=SGRS + LocoRE2026.01 | 79.7 | |
| LocoREBackbone=Qwen2.5-VL, Model Size=7B, Inference Strategy=LocoRE2026.01 | 77.9 | |
| LocoREBackbone=Qwen2-VL, Model Size=7B, Inference Strategy=LocoRE2026.01 | 77.8 | |
| SGRS + LocoREBackbone=LLaVA-1.5, Model Size=13B, Inference Strategy=SGRS + LocoRE2026.01 | 76.8 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL, Model Size=7B, Inference Strategy=Base2026.01 | 76.8 | |
| SGRS + LocoREBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=SGRS + LocoRE2026.01 | 76.7 | |
| Qwen2-VL-7BBackbone=Qwen2-VL, Model Size=7B, Inference Strategy=Base2026.01 | 75.6 | |
| LocoREBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=LocoRE2026.01 | 74.8 | |
| LLaVA-1.5-7B + FarSightBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=FarSight2026.01 | 74.7 | |
| LLaVA-1.5-7B + VissinkBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=Vissink2026.01 | 74.1 | |
| LocoREBackbone=LLaVA-1.5, Model Size=13B, Inference Strategy=LocoRE2026.01 | 74 | |
| LLaVA-1.5-7B + TAMEBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=TAME2026.01 | 73.9 | |
| LLaVA-1.5-7B + SIDBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=SID2026.01 | 73.4 | |
| LLaVA 1.5 + I-MoFres=224x224, #tokens=5122024.01 | 73.3 | |
| LLaVA 1.5 + I-MoFres=336x336, #tokens=11522024.01 | 73.3 | |
| InternVL2-8B2024.09 | 73.3 | |
| LLaVA-1.5-13BLLM=Vicuna-13B, Image Size=336x336, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 72.5 | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=Base2026.01 | 72.5 | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5, Model Size=13B, Inference Strategy=Base2026.01 | 72.5 | |
| LLaVA-1.5-13B-HDLLM=Vicuna-13B, Image Size=448x448, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 72 | |
| LLaVA-1.5-7B + OPERABackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=OPERA2026.01 | 72 | |
| LLaVoltaTrain #Tokens=10863, CR=170%, Time=17.6h2024.06 | 71.3 | |
| POINTS-7BLLM=Qwen-2.5-7B2024.09 | 71.1 | |
| LLaVA-13bTrain #Tokens=18432, CR=100%, Time=21.1h2024.06 | 71 | |
| LLaVA-1.5-7B + VCDBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=VCD2026.01 | 70.9 | |
| LLaVA 1.5res=336x336, #tokens=5762024.01 | 70.7 | |
| IXC-2.52024.09 | 70.2 | |
| LLaVA-1.5-7B + ICDBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=ICD2026.01 | 69.7 | |
| POINTS-9BLLM=Yi-1.5-9B2024.09 | 69.3 | |
| Idefics3-LLAMA3-8B2024.09 | 66.3 | |
| LLaVA-1.5-7BLLM=Vicuna-7B, Image Size=336x336, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 65.4 | |
| LLaVA-7BLLM=Vicuna-7B2023.10 | 62.8 | |
| LLaVA*Model Size=7B2023.12 | 62.6 | |
| InstructBLIP-8BLLM=Vicuna-7B, Image Size=224x224, Pre-train Sample Size=129M, Fine-tune Sample Size=1.2M2023.10 | 60.9 | |
| SEALModel Size=7B2023.12 | 59.1 | |
| InstructBLIP-14BLLM=Vicuna-13B, Image Size=224x224, Pre-train Sample Size=129M, Fine-tune Sample Size=1.2M2023.10 | 58.2 | |
| SGRS + LocoREBackbone=Intern-VL, Model Size=13B, Inference Strategy=SGRS + LocoRE2026.01 | 56.8 | |
| SGRS + LocoREBackbone=Intern-VL, Model Size=7B, Inference Strategy=SGRS + LocoRE2026.01 | 55.5 | |
| LocoREBackbone=Intern-VL, Model Size=13B, Inference Strategy=LocoRE2026.01 | 54.1 | |
| Intern-VL-13BBackbone=Intern-VL, Model Size=13B, Inference Strategy=Base2026.01 | 53.2 | |
| LocoREBackbone=Intern-VL, Model Size=7B, Inference Strategy=LocoRE2026.01 | 52.8 | |
| Intern-VL-7BBackbone=Intern-VL, Model Size=7B, Inference Strategy=Base2026.01 | 51.6 | |
| OFABackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 40.8 | |
| VisNecBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 39.5 | |
| PreSelBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 39.4 | |
| PreSelBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 39.4 | |
| BLIP2-14BLLM=Vicuna-13B, Image Size=224x224, Pre-train Sample Size=129M2023.10 | 38.1 | |
| CoIDOBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 37.6 | |
| CoIDOBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 37.6 | |
| Full-Data(186K)Backbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=100%2026.03 | 35.7 | |
| Full-DataBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=100%2026.05 | 35.7 | |
| ICONSBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 35.4 | |
| ICONSBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 35.4 | |
| COINCIDEBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 34.6 | |
| COINCIDEBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 34.6 | |
| XMASBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 34.2 | |
| XMASBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 34.2 | |
| RandomBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 33.5 | |
| RandomBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 33.5 | |
| EL2NBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 32.8 | |
| EL2NBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 32.8 | |
| Self-FilterBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 32.1 | |
| Self-FilterBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 32.1 | |
| CLIP-ScoreBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 31.2 | |
| CLIP-ScoreBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 31.2 | |
| TypiClustBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 30.4 | |
| TypiClustBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 30.4 | |
| IFDBackbone=LLaVA-v1.5-7B, Training Dataset=Vision-Flan-186K, Sampling Ratio=15% (28K)2026.03 | 29.8 | |
| IFDBackbone=LLaVA-v1.5-7B, Fine-tuning Dataset=Vision-Flan-186K, Sampling Ratio=15%2026.05 | 29.8 |