Multimodal Understanding on MMBench English
88.79AccuracyQwen3-VL-235B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-VL-235BToken Retention Ratio=100%2026.05 | 88.79 | — | — | |
| Qwen-VL-2.5-7B-OursCategory=Our Models2026.01 | 88.6 | — | — | |
| VisionZipToken Retention Ratio=60%2026.05 | 87.42 | — | — | |
| F3AToken Retention Ratio=60%2026.05 | 87.25 | — | — | |
| DivPruneToken Retention Ratio=60%2026.05 | 87.2 | — | — | |
| CDPrunerToken Retention Ratio=60%2026.05 | 86.94 | — | — | |
| Qwen-VL-2.5-7B-GRPOCategory=Our Models2026.01 | 86.8 | — | — | |
| Video-R1-7BCategory=Open-source Reasoning Models2026.01 | 86.5 | — | — | |
| F3AToken Retention Ratio=40%2026.05 | 86.34 | — | — | |
| FastVToken Retention Ratio=60%2026.05 | 86.33 | — | — | |
| VisionZipToken Retention Ratio=40%2026.05 | 86.33 | — | — | |
| Qwen-VL-2.5-7BCategory=Our Models2026.01 | 86.3 | — | — | |
| R1-VL-7BCategory=Open-source Reasoning Models2026.01 | 86.2 | — | — | |
| DivPruneToken Retention Ratio=40%2026.05 | 86.01 | — | — | |
| CDPrunerToken Retention Ratio=40%2026.05 | 85.84 | — | — | |
| F3AToken Retention Ratio=20%2026.05 | 85.33 | — | — | |
| FastVToken Retention Ratio=40%2026.05 | 85.02 | — | — | |
| InternVL2.5-8BCategory=Open-source Base Models2026.01 | 84.6 | — | — | |
| Qwen-VL-2.5-7B-SFTCategory=Our Models2026.01 | 83.9 | — | — | |
| Vision-R1-7BCategory=Open-source Reasoning Models2026.01 | 83.8 | — | — | |
| CDPrunerToken Retention Ratio=20%2026.05 | 83.72 | — | — | |
| InternVL3.5-8BRatio=100%, Backbone=InternVL3.5-8B2026.05 | 83.61 | — | — | |
| GPT-4oCategory=Closed-source2026.01 | 83.4 | — | — | |
| F3ARatio=60%, Backbone=InternVL3.5-8B2026.05 | 83.11 | — | — | |
| VisionZipToken Retention Ratio=20%2026.05 | 83.01 | — | — | |
| DivPruneToken Retention Ratio=20%2026.05 | 82.96 | — | — | |
| VisionZipRatio=60%, Backbone=InternVL3.5-8B2026.05 | 82.69 | — | — | |
| F3ARatio=40%, Backbone=InternVL3.5-8B2026.05 | 82.36 | — | — | |
| R1-OneVision-7BCategory=Open-source Reasoning Models2026.01 | 82.3 | — | — | |
| DivPruneRatio=60%, Backbone=InternVL3.5-8B2026.05 | 82.19 | — | — | |
| CDPrunerRatio=60%, Backbone=InternVL3.5-8B2026.05 | 82.17 | — | — | |
| FastVRatio=60%, Backbone=InternVL3.5-8B2026.05 | 82.02 | — | — | |
| VisionZipRatio=40%, Backbone=InternVL3.5-8B2026.05 | 81.85 | — | — | |
| LLaVA-OneVision-7BCategory=Open-source Video Models2026.01 | 81.7 | — | — | |
| FastVToken Retention Ratio=20%2026.05 | 81.55 | — | — | |
| MiniCPM-V2.6-8BCategory=Open-source Base Models2026.01 | 81.5 | — | — | |
| CDPrunerRatio=40%, Backbone=InternVL3.5-8B2026.05 | 81.34 | — | — | |
| FastVRatio=40%, Backbone=InternVL3.5-8B2026.05 | 81.1 | — | — | |
| DivPruneRatio=40%, Backbone=InternVL3.5-8B2026.05 | 81.1 | — | — | |
| F3ARatio=20%, Backbone=InternVL3.5-8B2026.05 | 79.6 | — | — | |
| VisionZipRatio=20%, Backbone=InternVL3.5-8B2026.05 | 78.85 | — | — | |
| DivPruneRatio=20%, Backbone=InternVL3.5-8B2026.05 | 78.18 | — | — | |
| CDPrunerRatio=20%, Backbone=InternVL3.5-8B2026.05 | 77.98 | — | — | |
| FastVRatio=20%, Backbone=InternVL3.5-8B2026.05 | 77 | — | — | |
| Gemini-1.5-ProCategory=Closed-source2026.01 | 73.9 | — | — | |
| AlignGPTLLM=Vicuna-13B, Resolution=3362024.05 | 69.5 | — | — | |
| LBRBackbone=LLaVA-NEXT-3B2026.05 | 69.4 | — | — | |
| LLaVA-NEXT-3BBackbone=LLaVA-NEXT-3B2026.05 | 69.2 | — | — | |
| LLaVA-NeXT-7BVisual tokens retained=Full, Pruning ratio=0%, Base Model=LLaVA-NeXT-7B2026.03 | 67.9 | — | 100 | |
| LLaVA-1.5LLM=Vicuna-13B, Resolution=3362024.05 | 67.7 | — | — | |
| AlignGPTLLM=Vicuna-7B, Resolution=3362024.05 | 67.3 | — | — | |
| LBRBackbone=LLaVA-1.5-13B2026.05 | 67.3 | — | — | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5-13B2026.05 | 67.1 | — | — | |
| ResPruneVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 66.6 | — | 99.6 | |
| VisionZIPVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 66.3 | — | 98.1 | |
| SparseVLMVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 65.9 | — | 96.9 | |
| LLaMA3.2-11BCategory=Open-source Base Models2026.01 | 65.8 | — | — | |
| DivPruneVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 65.8 | — | 97.2 | |
| LBRBackbone=LLaVA-1.5-7B2026.05 | 65.3 | — | — | |
| DARTVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 64.9 | — | 97.5 | |
| ResPruneVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 64.9 | — | 98.1 | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B2026.05 | 64.9 | — | — | |
| PruMergeVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 64.6 | — | 96.6 | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution=3362024.05 | 64.3 | — | — | |
| DARTVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 64.2 | — | 94.8 | |
| PDropVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 64.1 | — | 95.7 | |
| DivPruneVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 63.9 | — | 96.6 | |
| FastVVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 63.1 | — | 94.7 | |
| SparseVLMVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 63.1 | — | 93.1 | |
| VisionZIPVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 63.1 | — | 95 | |
| PruMergeVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 63 | — | 94.1 | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution=4482024.05 | 60.6 | — | — | |
| ShikraLLM=Vicuna-13B, Resolution=2242024.05 | 58.8 | — | — | |
| VILA-1.5-8BCategory=Open-source Video Models2026.01 | 57.6 | — | — | |
| PDropVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 55.5 | — | 83.5 | |
| IDEFICS-80BLLM=LLaMA-65B, Resolution=2242024.05 | 54.5 | — | — | |
| FastVVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 53.4 | — | 80.7 | |
| IDEFICS-9BLLM=LLaMA-7B, Resolution=2242024.05 | 48.2 | — | — | |
| MiniGPT-v2LLM=LLaMA2-7B, Resolution=4482024.05 | 43.1 | — | — | |
| Qwen-VLLLM=Qwen-7B, Resolution=4482024.05 | 38.2 | — | — | |
| InstructBLIPLLM=Vicuna-7B, Resolution=2242024.05 | 36 | — | — | |
| BAGELType=Native Unified, # Params.=14B2026.05 | — | 85 | — | |
| BAGEL# Params.=14B2026.06 | — | 85 | — | |
| BLIP3-oType=Composite Unified, # Params.=8B2026.05 | — | 75.5 | — | |
| CDPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=192, Pruning Ratio=66.7%2026.02 | — | 67.2 | — | |
| CDPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=128, Pruning Ratio=77.8%2026.02 | — | 67.5 | — | |
| CDPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=64, Pruning Ratio=88.9%2026.02 | — | 65.5 | — | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Retained Tokens=960, Pruning Ratio=66.7%2026.02 | — | 69.2 | — | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Retained Tokens=640, Pruning Ratio=77.8%2026.02 | — | 68.9 | — | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Retained Tokens=320, Pruning Ratio=88.9%2026.02 | — | 66.8 | — | |
| CogVLM-17BLLM=Vicuna-7B2024.04 | — | 65.8 | — | |
| DivPruneBackbone=LLaVA-1.5-13B, Retained Tokens=128, Pruning Ratio=77.8%2026.02 | — | 66.3 | — | |
| DivPruneBackbone=LLaVA-1.5-13B, Retained Tokens=64, Pruning Ratio=88.9%2026.02 | — | 64.1 | — | |
| DivPruneBackbone=LLaVA-NeXT-13B, Retained Tokens=640, Pruning Ratio=77.8%2026.02 | — | 67.5 | — | |
| DivPruneBackbone=LLaVA-NeXT-13B, Retained Tokens=320, Pruning Ratio=88.9%2026.02 | — | 65.9 | — | |
| Emu3Type=Native Unified, # Params.=8B2026.05 | — | 58.5 | — | |
| Emu3# Params.=8B2026.06 | — | 58.5 | — | |
| FastVBackbone=LLaVA-1.5-13B, Retained Tokens=128, Pruning Ratio=77.8%2026.02 | — | 66.1 | — | |
| FastVBackbone=LLaVA-1.5-13B, Retained Tokens=64, Pruning Ratio=88.9%2026.02 | — | 59.2 | — | |
| FastVBackbone=LLaVA-NeXT-13B, Retained Tokens=640, Pruning Ratio=77.8%2026.02 | — | 65.5 | — |