Multimodal Understanding on SEED-Bench Image
78AccuracyLLaVA-OneVision-72B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LLaVA-OneVision-72BModel Scale=72B2024.08 | 78 | — | — | |
| Qwen2.5VLSize=7B, Type=AR, Samples=>9M2025.12 | 77.5 | — | — | |
| BaselineBackbone=Qwen2-VL 7B, Token Retention Ratio=100%2026.05 | 76.5 | — | — | |
| GPT-4o2024.08 | 76.2 | — | — | |
| DiffusionVLSize=7B, Type=Diff., Samples=738K2025.12 | 75.5 | — | — | |
| LLaVA-OneVision-7BModel Scale=7B2024.08 | 75.4 | — | — | |
| LLaVA-OVSize=7B, Type=AR, Samples=7.8M2025.12 | 75.4 | — | — | |
| Qwen2.5VLSize=3B, Type=AR, Samples=>9M2025.12 | 74.8 | — | — | |
| LLaDA-VSize=8B, Type=Diff., Samples=16.5M2025.12 | 74.8 | — | — | |
| ARMORInterleaved text-image output=true, Params=8B, #Train images=5M, Image resolution=2562026.03 | 74.8 | — | — | |
| Cambrian-1Size=8B, Type=AR, Samples=-2025.12 | 74.7 | — | — | |
| RADIOv2.5-gResolution=672^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 74.3 | — | — | |
| InternVL2.5-4BComplexity=O(n)2025.12 | 74.1 | — | — | |
| RADIOv2.5-HResolution=768^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 74.1 | — | — | |
| OccamTokenBackbone=Qwen2-VL 7B, Token Retention Ratio=22.2%2026.05 | 74.1 | — | — | |
| RADIOv2.5-LResolution=768^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 74 | — | — | |
| DiffusionVLSize=3B, Type=Diff., Samples=738K2025.12 | 73.9 | — | — | |
| PReD2026.03 | 73.7 | — | — | |
| RADIOv2.1-HResolution=512^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 73.6 | — | — | |
| Qwen2.5VL-3BComplexity=O(n)2025.12 | 73.3 | — | — | |
| Gemma3-27BModel Size=27B2025.12 | 73.2 | — | — | |
| Gemma3-4B + AuditDMModel Size=4B, Auditing Component=AuditDM2025.12 | 72.9 | — | — | |
| InfiniteVL-4BComplexity=O(1)2025.12 | 72.9 | — | — | |
| SigLIP-SO400MResolution=384^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 72.9 | — | — | |
| OpenAI-CLIPResolution=336^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 72.7 | — | — | |
| Qwen-VL-Max2026.03 | 72.7 | — | — | |
| MM1.5-3BModel Scale=3B, Model Access Type=Proprietary2025.03 | 72.4 | — | — | |
| Qwen2-VL-2BModel Scale=2B, Model Access Type=Open-source2025.03 | 72.4 | — | — | |
| LLaVA-Next-Interleave-7B2026.03 | 72 | — | — | |
| BLIP-3-4BModel Scale=4B, Model Access Type=Open-source2025.03 | 71.8 | — | — | |
| RADIOv2.1-HResolution=768^2, Tokens/im=196, LLM=MN-Minitron-8B, Data mixture=LLaVA1.62024.12 | 71.7 | — | — | |
| PACT CVPR-25Backbone=Qwen2-VL 7B, Token Retention Ratio=22.2%2026.05 | 71.7 | — | — | |
| PaliGemma2-3BComplexity=O(n)2025.12 | 71.6 | — | — | |
| GPT-4v2026.03 | 71.6 | — | — | |
| LBRBackbone=LLaVA-NEXT-3B2026.05 | 71.5 | — | — | |
| LLaVA-NEXT-3BBackbone=LLaVA-NEXT-3B2026.05 | 71.4 | — | — | |
| Phi-3.5-Vision-4BComplexity=O(n)2025.12 | 71.2 | — | — | |
| SmolVLM2-2BComplexity=O(n)2025.12 | 70.9 | — | — | |
| Phi-3-Vision-4BModel Scale=4B, Model Access Type=Open-source2025.03 | 70.9 | — | — | |
| VIFLLM=Vicuna-7B, Resolution=336 × 3362026.04 | 70.8 | — | — | |
| PPLLAVAResolution=336*3362024.11 | 70.7 | — | — | |
| Gemma3-12BModel Size=12B2025.12 | 70.6 | — | — | |
| OccamTokenBackbone=Qwen2-VL 7B, Token Retention Ratio=11.1%2026.05 | 70.6 | — | — | |
| LLaVA-Next-7BResolution=672*6722024.11 | 70.2 | — | — | |
| TinyLLaVA-3BComplexity=O(n)2025.12 | 70.2 | — | — | |
| LLaVA-NeXT Vanilla 7BToken Budget=2880, Backbone=LLaVA-NeXT 7B2025.08 | 70.2 | 100 | — | |
| Janus-ProInterleaved text-image output=false, Params=7B, #Train images=72M, Image resolution=3842026.03 | 70.1 | — | — | |
| DeepSeek-VL-7B2026.03 | 70.1 | — | — | |
| LLaVA-NeXTLLM=Mistral-7B, Resolution=672 × 6722026.04 | 69.6 | — | — | |
| LLaVA-Instruct-13BLLM=Vicuna-1.5-13B, Resolution=3362024.06 | 69.4 | — | — | |
| AKI-4BModel Scale=4B, Model Access Type=Open-source2025.03 | 69.4 | — | — | |
| ShareGPT4V-7B2026.03 | 69.3 | — | — | |
| MM1-3BModel Scale=3B, Model Access Type=Proprietary2025.03 | 68.8 | — | — | |
| TokenFlow-XLInterleaved text-image output=false, Params=13B, #Train images=60M, Image resolution=3842026.03 | 68.7 | — | — | |
| ASPOBase Model=LLaVA-v1.5, Model Scale=13B, Optimization Protocol=ASPO2025.05 | 68.5 | — | 68.8 | |
| IGVALLM=Vicuna-7B, Resolution=336 × 3362026.04 | 68.3 | — | — | |
| LLaVA-1.5-13BLLM=Vicuna-1.5-13B, Resolution=3362024.06 | 68.2 | — | — | |
| LLaVA-1.5-13BResolution=336*3362024.11 | 68.2 | — | — | |
| LLaVA-1.5LLM=Vicuna-13B, Resolution=3362024.05 | 68.2 | — | — | |
| LLaVA-1.5-13BBase Model=LLaVA-v1.5, Model Scale=13B, Optimization Protocol=Base2025.05 | 68.2 | — | 65.93 | |
| DPOBase Model=LLaVA-v1.5, Model Scale=13B, Optimization Protocol=DPO2025.05 | 68.2 | — | 67.03 | |
| VILA-1.5-3BModel Scale=3B, Model Access Type=Open-source2025.03 | 68 | — | — | |
| LBRBackbone=LLaVA-1.5-13B2026.05 | 68 | — | — | |
| AlignGPTLLM=Vicuna-13B, Resolution=3362024.05 | 67.8 | — | — | |
| VisionZip (diamond variant)Token Budget=640, Backbone=LLaVA-NeXT 7B2025.08 | 67.8 | 96.6 | — | |
| MMTokToken Budget=640, Backbone=LLaVA-NeXT 7B2025.08 | 67.74 | 96.5 | — | |
| LLaVA-Instruct-7BLLM=Vicuna-1.5-7B, Resolution=3362024.06 | 67.7 | — | — | |
| DivPruneToken Budget=640, Backbone=LLaVA-NeXT 7B2025.08 | 67.56 | 96.2 | — | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5-13B2026.05 | 67.5 | — | — | |
| LLaVA-v1.5LLM=Vicuna-7B, Resolution=336 × 3362026.04 | 67.2 | — | — | |
| LOVA3-7BTrain Paradigm=VQA, GenQA, EvalQA, LLM=Vicuna-7B2024.05 | 67.1 | — | — | |
| MiniCPM-V-22026.03 | 67.1 | — | — | |
| MiniCPM-V2-3BModel Scale=3B, Model Access Type=Open-source2025.03 | 67.1 | — | — | |
| VisionZipToken Budget=640, Backbone=LLaVA-NeXT 7B2025.08 | 66.7 | 95 | — | |
| AlignGPTLLM=Vicuna-7B, Resolution=3362024.05 | 66.5 | — | — | |
| LaViDa-LSize=8B, Type=Diff., Samples=1.6M2025.12 | 66.5 | — | — | |
| LLaVA-13bTrain #Tokens=18432, CR=100%, Time=21.1h2024.06 | 66.4 | — | — | |
| LLaVoltaTrain #Tokens=10863, CR=170%, Time=17.6h2024.06 | 66.4 | — | — | |
| ASPOBase Model=LLaVA-v1.5, Model Scale=7B, Optimization Protocol=ASPO2025.05 | 66.3 | — | 65.16 | |
| MMTokToken Budget=320, Backbone=LLaVA-NeXT 7B2025.08 | 66.29 | 94.4 | — | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution=3362024.05 | 66.2 | — | — | |
| LLaVA-1.5Train Paradigm=VQA, LLM=Vicuna-7B2024.05 | 66.2 | — | — | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B2026.05 | 66.2 | — | — | |
| DPOBase Model=LLaVA-v1.5, Model Scale=7B, Optimization Protocol=DPO2025.05 | 66.1 | — | 63.12 | |
| LLaVA-1.5Size=7B, Type=AR, Samples=-2025.12 | 66.1 | — | — | |
| DeepSeek-VL-1.3BModel Scale=1.3B, Model Access Type=Open-source2025.03 | 66 | — | — | |
| PACT CVPR-25Backbone=Qwen2-VL 7B, Token Retention Ratio=11.1%2026.05 | 66 | — | — | |
| VisionZip (diamond variant)Token Budget=320, Backbone=LLaVA-NeXT 7B2025.08 | 65.9 | 93.9 | — | |
| LBRBackbone=LLaVA-1.5-7B2026.05 | 65.9 | — | — | |
| LLaVA-1.5-7BModel Scale=7B, Model Access Type=Open-source2025.03 | 65.8 | — | — | |
| LLaVA-1.5-7BBase Model=LLaVA-v1.5, Model Scale=7B, Optimization Protocol=Base2025.05 | 65.7 | — | 62.59 | |
| Gemma3-4BModel Size=4B2025.12 | 65.7 | — | — | |
| MaTVLM-3BComplexity=O(n)2025.12 | 65.6 | — | — | |
| LLaVA-OneVision-0.5BModel Scale=0.5B2024.08 | 65.5 | — | — | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution=4482024.06 | 65.4 | — | — | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution=448 × 4482026.04 | 65.4 | — | — | |
| DivPruneToken Budget=320, Backbone=LLaVA-NeXT 7B2025.08 | 65.35 | 93.1 | — | |
| TG-LLaVALLM=Vicuna-7B, Resolution=336 × 3362026.04 | 65 | — | — | |
| LLaVA-Next-VideoResolution=336*3362024.11 | 64.6 | — | — | |
| MMTokToken Budget=160, Backbone=LLaVA-NeXT 7B2025.08 | 64.54 | 91.9 | — |