Multimodal Understanding on SEED-Bench
81.7AccuracyLLaVA-UHD
Evaluation Results
| Method | Links | |||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| LLaVA-UHDVision Encoder=CLIP-L, Resolution=1008, LLM=Vicuna-13B, Data=81.72025.01 | 81.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaAverage Token Reduction=0.0%, Backbone=Qwen3-VL-8B2026.06 | 80.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8B-ThinkingBackbone=Qwen3-VL-8B, Strategy=LongCoT (Thinking)2026.02 | 78.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PDropAverage Token Reduction=66.7%, Backbone=Qwen3-VL-8B2026.06 | 77.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BLIP-3oUnified=✓, #Params=8B, Visual Representation Type=Continuous2026.06 | 77.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SAPBackbone=Qwen3-VL-8B, Strategy=SAP2026.02 | 77.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PDrop+RerouteAverage Token Reduction=66.7%, Backbone=Qwen3-VL-8B2026.06 | 76.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaMA3-VType=Diff., LLM Tower=LLaMA3-8B2026.01 | 76.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RubiCap-3BBackbone=QwenVL2.5-3B2026.05 | 75.77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CapRL-3BBackbone=QwenVL2.5-3B2026.05 | 75.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BalCapRL-3BBackbone=QwenVL2.5-3B2026.05 | 75.55 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MUSE-3B# LLM Params=2B2026.05 | 75.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OVType=AR, LLM Tower=Qwen2-7B2026.01 | 75.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision2026.03 | 75.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cambrian-1-34BLanguage Model Scale=34B, Training Data Scale=Large2025.01 | 75.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3# LLM Params=1.8B2026.05 | 75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniLIP-3B# LLM Params=2B2026.05 | 75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QwenVL2.5-3BModel size=3B2026.05 | 74.94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaDA-VType=Diff., LLM Tower=LLaDA-8B2026.01 | 74.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ShareGPT5V-mini-SFTTraining=SFT2026.05 | 74.51 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| X-Omni2026.03 | 74.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fine-R1-3BModel Size=3B2026.02 | 73.99 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OursType=Diff., LLM Tower=LLaDA-8B2026.01 | 73.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GvU2026.03 | 73.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VILA-1.5Language Model Scale=7B, Training Data Scale=Standard2025.01 | 73.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BLIP3-o# LLM Params=4B2026.05 | 73.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3BModel Size=3B2026.02 | 73.74 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ARMUnified=✓, #Params=7B, Visual Representation Type=Discrete2026.06 | 73.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VILAModel Scale=13B2024.02 | 73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tar# LLM Params=7B2026.05 | 73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-PlusLLM Size=Unk2024.03 | 72.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-MAXLLM Size=Unk2024.03 | 72.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVAverage Token Reduction=66.7%, Backbone=Qwen3-VL-8B2026.06 | 72.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVLM-1.7BVision Encoder=FastViTHD, LLM=Qw.2, #Visual Tokens=256, Vis. Enc. Size (M)=125, Evaluation Library=lmms-eval2024.12 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Jigsaw-R1Prompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 72.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LeoLanguage Model Scale=7B, Training Data Scale=Standard2025.01 | 72.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PIIP-LLaVAVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/336, LLM=Vicuna-7B, Data=2.7M2025.01 | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaDA-V w/dllm-cacheType=Diff., LLM Tower=LLaDA-8B2026.01 | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Janus-Pro# LLM Params=7B2026.05 | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Janus-ProUnified=✓, #Params=7B, Visual Representation Type=Continuous2026.06 | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NextLLM Size=13B2024.03 | 71.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JigsawPrompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 71.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Janus-Pro2026.03 | 71.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PDrop+RerouteAverage Token Reduction=77.8%, Backbone=Qwen3-VL-8B2026.06 | 71.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MixPrompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 71.85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MetaMorphType=AR+Diff., LLM Tower=LLaMA3.1-8B2026.01 | 71.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastV+RerouteAverage Token Reduction=66.7%, Backbone=Qwen3-VL-8B2026.06 | 71.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4VLLM Size=Unk2024.03 | 71.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MUSE-1B# LLM Params=1B2026.05 | 71.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLAVA-PhiLLM Param=2.7B, Type=Und. Only2024.11 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LASER-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=80%, Precision=FP162026.05 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.31 | — | |
| LASER-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=90%, Precision=FP162026.05 | 71.39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.31 | — | |
| LASER-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=60%, Precision=FP162026.05 | 71.37 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.31 | — | |
| LASER-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=70%, Precision=FP162026.05 | 71.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.31 | — | |
| SmolVLM2-2.2BVision Encoder=ViT-SO400M, LLM=SmolLM2, #Visual Tokens=2106*, Vis. Enc. Size (M)=430, Evaluation Library=lmms-eval2024.12 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FP16 BaselineBackbone=LLaVA-Next 13B, Precision=FP162026.04 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.27 | — | |
| FP16model_version=LLaVA-Next, model_scale=13B2026.04 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.23 | — | |
| FP16Model Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=100%, Precision=FP162026.05 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.27 | — | |
| WSVD-noQBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=90%, Precision=FP162026.04 | 71.29 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.17 | — | |
| WSVD-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=90%, Precision=FP162026.05 | 71.29 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.17 | — | |
| WSVD-noQBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=70%, Precision=FP162026.04 | 71.25 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.17 | — | |
| WSVD-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=70%, Precision=FP162026.05 | 71.25 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.17 | — | |
| LASER-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=50%, Precision=FP162026.05 | 71.25 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.31 | — | |
| QSVD-noQBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=90%, Precision=FP162026.04 | 71.23 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.44 | — | |
| QSVD-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=90%, Precision=FP162026.05 | 71.23 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.44 | — | |
| WSVD-noQBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=80%, Precision=FP162026.04 | 71.17 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.17 | — | |
| WSVD-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=80%, Precision=FP162026.05 | 71.17 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.17 | — | |
| InternVL3# LLM Params=1B2026.05 | 71.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QSVD-noQBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=70%, Precision=FP162026.04 | 71.06 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.44 | — | |
| QSVD-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=70%, Precision=FP162026.05 | 71.06 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.44 | — | |
| QSVD-noQBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=80%, Precision=FP162026.04 | 71.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.44 | — | |
| QSVD-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=80%, Precision=FP162026.05 | 71.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.44 | — | |
| UniLIP-1B# LLM Params=1B2026.05 | 71 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WSVD-noQBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=60%, Precision=FP162026.04 | 70.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.17 | — | |
| WSVD-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=60%, Precision=FP162026.05 | 70.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.17 | — | |
| QSVD-noQBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=60%, Precision=FP162026.04 | 70.92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.44 | — | |
| QSVD-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=60%, Precision=FP162026.05 | 70.92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.44 | — | |
| ASVDBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=90%, Precision=FP162026.04 | 70.88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.43 | — | |
| WSVD-noQBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=50%, Precision=FP162026.04 | 70.81 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.17 | — | |
| WSVD-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=50%, Precision=FP162026.05 | 70.81 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.17 | — | |
| Qwen 2.5 VLPrompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 70.78 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SVD-LLMBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=90%, Precision=FP162026.04 | 70.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.94 | — | |
| SVD-LLMModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=90%, Precision=FP162026.05 | 70.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.94 | — | |
| Gemini ProLLM Size=Unk2024.03 | 70.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PDropAverage Token Reduction=77.8%, Backbone=Qwen3-VL-8B2026.06 | 70.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WSVDmodel_version=LLaVA-Next, model_scale=13B2026.04 | 70.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.1 | — | |
| SVD-LLMBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=80%, Precision=FP162026.04 | 70.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.94 | — | |
| SVD-LLMModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=80%, Precision=FP162026.05 | 70.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.94 | — | |
| FlorenceVL-3BVision Encoder=DaViT, LLM=Phi-3, #Visual Tokens=576, Vis. Enc. Size (M)=770, Evaluation Library=lmms-eval2024.12 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SCLBackbone=InternLM-XComposer-2-7B, Strategy=SCL2024.10 | 70.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PIIP-LLaVAVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/336, LLM=Vicuna-13B, Data=1.2M2025.01 | 70.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JanusFlowLLM Param=1.3B, Type=Unified2024.11 | 70.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JanusFlowType=AR+Diff., LLM Tower=DeepSeek-1.3B2026.01 | 70.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-VLLLM Size=7B2024.03 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BToken Budget=Full2026.01 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-VLType=AR, LLM Tower=DeepSeek-7B2026.01 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QSVD-noQBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=50%, Precision=FP162026.04 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.44 | — | |
| QSVD-noQModel Architecture=LLaVA-Next 13B, Parameter Ratio (rho1)=50%, Precision=FP162026.05 | 70.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.44 | — | |
| VLM-R1Prompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 70.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ASVDBackbone=LLaVA-Next 13B, Parameter Ratio (ρ1)=80%, Precision=FP162026.04 | 70.26 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.43 | — |