Vision Understanding on MMBench
85AccuracyBAGEL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BAGEL2025.06 | 85 | — | — | |
| BLIP3-o2025.06 | 83.5 | — | — | |
| MetaQuery2025.06 | 83.5 | — | — | |
| UniWorld-V12025.06 | 83.5 | — | — | |
| UniMRGType=Unified, # LLM Params=2B2026.01 | 81.44 | — | — | |
| InternVL3Type=Und. Only, # LLM Params=2B2026.01 | 81.19 | — | — | |
| OpenUniType=Unified, # LLM Params=2B2026.01 | 81.19 | — | — | |
| UniLIPType=Unified, # LLM Params=2B2026.01 | 80.7 | — | — | |
| BAGELType=Unified, # LLM Params=3B2026.01 | 79.2 | — | — | |
| Qwen2.5-VLType=Und. Only, # LLM Params=3B2026.01 | 78.26 | — | — | |
| Qwen3-VLType=Und. Only, # LLM Params=2B2026.01 | 77.32 | — | — | |
| Janus-Pro2025.06 | 75.5 | — | — | |
| ILLUMELLM=Vicuna-7B, Resolution=-2026.03 | 75.1 | — | — | |
| DualTokenLLM=LLaMA-2-7B, Resolution=2562026.03 | 74.9 | — | — | |
| EvoTokLLM=Qwen-2.5-7B-Inst., Resolution=2562026.03 | 74.9 | — | — | |
| UIO-2XXLModel Size=6.8B2023.12 | 71.5 | — | — | |
| Unified-IO 2LLM=6.8B from scratch, Resolution=3842026.03 | 71.5 | — | — | |
| Janus2025.06 | 69.4 | — | — | |
| SIMABase Model=VILA-7B2024.05 | 69.2 | — | — | |
| GT-DPOBase Model=VILA-7B2024.05 | 69 | — | — | |
| VILA-7BBase Model=VILA-7B2024.05 | 68.9 | — | — | |
| VILALLM=LLaMA-2-7B, Resolution=3362026.03 | 68.9 | — | — | |
| ShareGPT4VLLM=Vicuna-7B, Resolution=3362026.03 | 68.8 | — | — | |
| SIMABase Model=LLaVA-1.5-13B2024.05 | 68.4 | — | — | |
| Dynamic-LLaVA-13B^VFree=false, Image (prefill) Token=115, TFLOPs=4.72024.12 | 68.3 | — | — | |
| UIO-2XLModel Size=3.2B2023.12 | 68.1 | — | — | |
| GT-DPOBase Model=LLaVA-1.5-13B2024.05 | 68 | — | — | |
| LLaVA-TokenPacker-13B-144TokenProjector=TokenPacker, Image Resolution=336, Prefill Tokens=144, Prefill TFLOPs=4.92024.12 | 68 | — | — | |
| VIG training + LACINGBase Model=LLaVA-1.5 7B2026.02 | 67.89 | — | — | |
| LLaVa-1.5Model Size=13B2023.12 | 67.7 | — | — | |
| LLaVA-1.5-13BBase Model=LLaVA-1.5-13B2024.05 | 67.7 | — | — | |
| LLaVA-1.5-13BImage (prefill) Token=576, TFLOPs=19.62024.12 | 67.7 | — | — | |
| LLaVA-v1.5LLM=Vicuna-1.5-13B, Resolution=3362026.03 | 67.7 | — | — | |
| VIG training + VARBase Model=LLaVA-1.5 7B2026.02 | 67.66 | — | — | |
| VIG training + VCDBase Model=LLaVA-1.5 7B2026.02 | 67.65 | — | — | |
| TokLIPLLM=Qwen2.5-7B-Inst., Resolution=3842026.03 | 67.6 | — | — | |
| Dynamic-LLaVA-TokenPacker-13B_VProjector=TokenPacker, Image Resolution=336, Prefill Tokens=57, Prefill TFLOPs=2.12024.12 | 67.4 | — | — | |
| VanillaBackbone=LLaVA-Next-7B, Token Reduction Rate=0.0%2025.05 | 67.4 | — | — | |
| VIG training + PAIBase Model=LLaVA-1.5 7B2026.02 | 67.34 | — | — | |
| LLaVA-FastV (13B)Image (prefill) Token=144, TFLOPs=62024.12 | 66.9 | — | — | |
| Dynamic-LLaVA-13B^ITFree=false, Image (prefill) Token=115, TFLOPs=4.72024.12 | 66.9 | — | — | |
| LLaVA-TokenPacker-FastV-13B k=3, r=0.5Projector=TokenPacker, Image Resolution=336, Prefill Tokens=72, Prefill TFLOPs=2.62024.12 | 66.8 | — | — | |
| Dynamic-LLaVA-TokenPacker-13B_VTProjector=TokenPacker, Image Resolution=336, Prefill Tokens=57, Prefill TFLOPs=2.12024.12 | 66.8 | — | — | |
| Janus-ProType=Unified, # LLM Params=7B2026.01 | 66.67 | — | — | |
| LACINGBase Model=LLaVA-1.5 7B2026.02 | 66.45 | — | — | |
| LLaVA-HiRED (7B)Free=true, Image (prefill) Token=115, TFLOPs=22024.12 | 66.4 | — | — | |
| VIG trainingBase Model=LLaVA-1.5 7B2026.02 | 66.33 | — | — | |
| VARBase Model=LLaVA-1.5 7B2026.02 | 66.3 | — | — | |
| LLaVA-LDP-v2-7BProjector=LDP-v2, Image Resolution=336, Prefill Tokens=144, Prefill TFLOPs=2.52024.12 | 66.2 | — | — | |
| LLaVA-TokenPacker-13B-64TokenProjector=TokenPacker, Image Resolution=336, Prefill Tokens=64, Prefill TFLOPs=2.22024.12 | 66.2 | — | — | |
| MoB (with η-prior)Backbone=LLaVA-Next-7B, Objectives=PA VP, Pruning budget K=320, Token Reduction Rate=88.9%2025.05 | 65.8 | — | — | |
| LLaVA-PruMerge+ (13B)Image (prefill) Token=146, TFLOPs=4.92024.12 | 65.7 | — | — | |
| LLaVA-1.5 7B2026.02 | 65.46 | — | — | |
| PAIBase Model=LLaVA-1.5 7B2026.02 | 65.45 | — | — | |
| Dynamic-LLaVA-7B_VProjector=MLP, Image Resolution=336, Prefill Tokens=115, Prefill TFLOPs=2.52024.12 | 65.4 | — | — | |
| Dynamic-LLaVA-7B^VFree=false, Image (prefill) Token=115, TFLOPs=2.52024.12 | 65.4 | — | — | |
| DARTBackbone=LLaVA-Next-7B, Objectives=VP, Pruning budget K=320, Token Reduction Rate=88.9%2025.05 | 65.3 | — | — | |
| LLaVA-TokenPacker-7B-144TokenProjector=TokenPacker, Image Resolution=336, Prefill Tokens=144, Prefill TFLOPs=2.52024.12 | 65.1 | — | — | |
| Dynamic-LLaVA-TokenPacker-7B_VProjector=TokenPacker, Image Resolution=336, Prefill Tokens=57, Prefill TFLOPs=1.12024.12 | 65.1 | — | — | |
| LLaVA-TokenPacker-FastV-7B k=3, r=0.5Projector=TokenPacker, Image Resolution=336, Prefill Tokens=72, Prefill TFLOPs=1.42024.12 | 65 | — | — | |
| SIMABase Model=LLaVA-1.5-7B2024.05 | 64.9 | — | — | |
| LLaVA-PruMerge+ (7B)Image (prefill) Token=146, TFLOPs=2.52024.12 | 64.9 | — | — | |
| VanillaBase Model=LLaVA-1.5-7B, Retained Tokens=576, Reduction Rate=0%2026.02 | 64.7 | — | — | |
| VanillaBackbone=LLaVA-1.5-7B, Token Reduction Rate=0.0%2025.05 | 64.7 | — | — | |
| GT-DPOBase Model=LLaVA-1.5-7B2024.05 | 64.6 | — | — | |
| mPLUG-Owl2Model Size=8.2B2023.12 | 64.5 | — | — | |
| Emu3-ChatType=Und. Only, # LLM Params=8B2026.01 | 64.35 | — | — | |
| VCDBase Model=LLaVA-1.5 7B2026.02 | 64.34 | — | — | |
| LLaVa-1.5Model Size=7.2B2023.12 | 64.3 | — | — | |
| LLaVA-1.5-7BBase Model=LLaVA-1.5-7B2024.05 | 64.3 | — | — | |
| LLaVA-1.5-7BProjector=MLP, Image Resolution=336, Prefill Tokens=576, Prefill TFLOPs=10.12024.12 | 64.3 | — | — | |
| LLaVA-1.5-7BImage (prefill) Token=576, TFLOPs=10.12024.12 | 64.3 | — | — | |
| POVIDBase Model=LLaVA-1.5-7B2024.05 | 64.1 | — | — | |
| Dynamic-LLaVA-7B_VTProjector=MLP, Image Resolution=336, Prefill Tokens=115, Prefill TFLOPs=2.52024.12 | 64.1 | — | — | |
| LLaVA-TokenPacker-7B-64TokenProjector=TokenPacker, Image Resolution=336, Prefill Tokens=64, Prefill TFLOPs=1.12024.12 | 64.1 | — | — | |
| Dynamic-LLaVA-7B^ITFree=false, Image (prefill) Token=115, TFLOPs=2.52024.12 | 64.1 | — | — | |
| MoB (+ η-prior)Backbone=LLaVA-1.5-7B, Objectives=-, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 64.1 | — | — | |
| LLaVA-Pixel-Shuffle-7BProjector=Pixel-Shuffle, Image Resolution=336, Prefill Tokens=144, Prefill TFLOPs=2.52024.12 | 64 | — | — | |
| HA-DPOBase Model=LLaVA-1.5-7B2024.05 | 63.9 | — | — | |
| MoB (w/o η-prior)Backbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 63.8 | — | — | |
| DARTBackbone=LLaVA-1.5-7B, Objectives=VP, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 63.6 | — | — | |
| Dynamic-LLaVA-TokenPacker-7B_VTProjector=TokenPacker, Image Resolution=336, Prefill Tokens=57, Prefill TFLOPs=1.12024.12 | 63.5 | — | — | |
| LLaVA-FastV (7B)Free=true, Image (prefill) Token=144, TFLOPs=3.22024.12 | 63.5 | — | — | |
| MoB (+ η-prior)Backbone=LLaVA-1.5-7B, Objectives=-, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 63.5 | — | — | |
| ApETBase Model=LLaVA-1.5-7B, Retained Tokens=192, Reduction Rate=66.7%2026.02 | 63.4 | — | — | |
| PDropBase Model=LLaVA-1.5-7B, Retained Tokens=192, Reduction Rate=66.7%2026.02 | 63.3 | — | — | |
| DARTBackbone=LLaVA-1.5-7B, Objectives=VP, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 63.2 | — | — | |
| MoB (w/o η-prior)Backbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=128, Token Reduction Rate=77.8%2025.05 | 63.2 | — | — | |
| LLaVA-Resampler-7BProjector=Resampler, Image Resolution=336, Prefill Tokens=144, Prefill TFLOPs=2.52024.12 | 63.1 | — | — | |
| LLaVA-C-Abstractor-7BProjector=C-Abstractor, Image Resolution=336, Prefill Tokens=144, Prefill TFLOPs=2.52024.12 | 63.1 | — | — | |
| VisionZipBase Model=LLaVA-1.5-7B, Retained Tokens=192, Reduction Rate=66.7%2026.02 | 63 | — | — | |
| MustDropBackbone=LLaVA-Next-7B, Objectives=PA VP, Pruning budget K=320, Token Reduction Rate=88.9%2025.05 | 62.8 | — | — | |
| SparseVLMBase Model=LLaVA-1.5-7B, Retained Tokens=192, Reduction Rate=66.7%2026.02 | 62.5 | — | — | |
| SparseVLMBackbone=LLaVA-1.5-7B, Objectives=PA, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 62.5 | — | — | |
| ApETBase Model=LLaVA-1.5-7B, Retained Tokens=128, Reduction Rate=77.8%2026.02 | 62.3 | — | — | |
| MustDropBackbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=192, Token Reduction Rate=66.7%2025.05 | 62.3 | — | — | |
| UIO-2LModel Size=1.1B2023.12 | 62.1 | — | — | |
| MoB (+ η-prior)Backbone=LLaVA-1.5-7B, Objectives=-, Pruning budget K=64, Token Reduction Rate=88.9%2025.05 | 62.1 | — | — | |
| VisionZipBase Model=LLaVA-1.5-7B, Retained Tokens=128, Reduction Rate=77.8%2026.02 | 62 | — | — | |
| MoB (w/o η-prior)Backbone=LLaVA-1.5-7B, Objectives=PA VP, Pruning budget K=64, Token Reduction Rate=88.9%2025.05 | 61.7 | — | — |