Multimodal Understanding on MMB
90.6AccuracyQwen3-VL-32B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-VL-32B2025.12 | 90.6 | — | |
| InternVL3.5-38B2025.12 | 90.3 | — | |
| MastersBase Model=InternVL3-8B2025.12 | 90.1 | — | |
| Gemini-2.0-Flash2025.12 | 90 | — | |
| MastersBase Model=Qwen3-VL-8B2025.12 | 89.5 | — | |
| InternVL2.5-8B-GenRecalTeacher VLM=Qwen2-VL-72B2025.06 | 89.5 | — | |
| InternVL2.5-8B-GenRecalTeacher VLM=InternVL2.5-78B2025.06 | 89.5 | — | |
| MastersBase Model=Qwen2.5-VL-7B2025.12 | 89.1 | — | |
| InternVL3-78B2025.12 | 89 | — | |
| InternVL2.5-8B-GenRecalTeacher VLM=InternVL2-76B2025.06 | 89 | — | |
| InternVL2.5-8B-GenRecalTeacher VLM=NVLM-72B2025.06 | 88.8 | — | |
| Qwen2.5-VL-72B2025.12 | 88.6 | — | |
| InternVL2.5-78B2025.06 | 88.3 | — | |
| MastersBase Model=InternVL3.5-8B2025.12 | 88.2 | — | |
| Qwen2-VL-72B2025.06 | 86.5 | — | |
| InternVL2-76B2025.06 | 86.5 | — | |
| LLaVA-OneVision-72B2025.12 | 85.8 | — | |
| LLaVA-OneVision-72B2025.06 | 85.8 | — | |
| Claude-3.7-Sonnet2025.12 | 84.8 | — | |
| GPT-4o2025.12 | 83.4 | — | |
| GPT-4o (0513)2025.06 | 83.4 | — | |
| VanillaBackbone=Qwen-2.5-VL-7B, Token Retention Rate=100%2026.02 | 83.3 | — | |
| VanillaBackbone=Qwen2.5-VL-7B, Token Pruning Rate=0%2026.06 | 82.8 | — | |
| Claude-3.5-Sonnet2025.12 | 82.6 | — | |
| Claude-3.5-Sonnet2025.06 | 82.6 | — | |
| StepPruneBackbone=Qwen2.5-VL-7B, Token Pruning Rate=66.7%2026.06 | 80.5 | — | |
| Qwen2.5-VL-7BToken Retention Ratio=100%, Backbone=Qwen2.5-VL-7B2026.02 | 79.8 | — | |
| VisionZipBackbone=Qwen-2.5-VL-7B, Token Retention Rate=20%2026.02 | 79.3 | — | |
| ApETBackbone=Qwen-2.5-VL-7B, Token Retention Rate=20%2026.02 | 78.6 | — | |
| StepPruneBackbone=Qwen2.5-VL-7B, Token Pruning Rate=77.8%2026.06 | 78.4 | — | |
| HoloVBackbone=Qwen2.5-VL-7B, Token Pruning Rate=66.7%2026.06 | 78.3 | — | |
| EntropyPruneToken Retention Ratio=25%, Backbone=Qwen2.5-VL-7B2026.02 | 77.9 | — | |
| FastVToken Retention Ratio=25%, Backbone=Qwen2.5-VL-7B2026.02 | 77.7 | — | |
| PDropBackbone=Qwen-2.5-VL-7B, Token Retention Rate=20%2026.02 | 77.3 | — | |
| HoloVBackbone=Qwen2.5-VL-7B, Token Pruning Rate=77.8%2026.06 | 76.5 | — | |
| SparseVLMBackbone=Qwen-2.5-VL-7B, Token Retention Rate=20%2026.02 | 76 | — | |
| StepPruneBackbone=Qwen2.5-VL-7B, Token Pruning Rate=88.9%2026.06 | 75.9 | — | |
| FastVBackbone=Qwen2.5-VL-7B, Token Pruning Rate=66.7%2026.06 | 75.7 | — | |
| VisionZipBackbone=Qwen-2.5-VL-7B, Token Retention Rate=10%2026.02 | 75.6 | — | |
| FastVBackbone=Qwen2.5-VL-7B, Token Pruning Rate=77.8%2026.06 | 74.9 | — | |
| CDPrunerToken Retention Ratio=25%, Backbone=Qwen2.5-VL-7B2026.02 | 74.3 | — | |
| Gemini-1.5-Pro2025.12 | 73.9 | — | |
| Gemini-1.5-Pro2025.06 | 73.9 | — | |
| PDropBackbone=Qwen-2.5-VL-7B, Token Retention Rate=10%2026.02 | 73.6 | — | |
| TaiChiLLM=Qwen2.5-14B, Resolution=336, Zero-shot evaluation=true2026.02 | 73.5 | — | |
| EntropyPruneToken Retention Ratio=12.5%, Backbone=Qwen2.5-VL-7B2026.02 | 73.3 | — | |
| ApETBackbone=Qwen-2.5-VL-7B, Token Retention Rate=10%2026.02 | 72.6 | — | |
| HoloVBackbone=Qwen2.5-VL-7B, Token Pruning Rate=88.9%2026.06 | 72.4 | — | |
| SparseVLMBackbone=Qwen-2.5-VL-7B, Token Retention Rate=10%2026.02 | 71.7 | — | |
| CDPrunerToken Retention Ratio=12.5%, Backbone=Qwen2.5-VL-7B2026.02 | 71.6 | — | |
| LLaVA-1.5LLM=Vicuna-13B, Resolution=336, Zero-shot evaluation=true2026.02 | 69.2 | — | |
| FastVBackbone=Qwen2.5-VL-7B, Token Pruning Rate=88.9%2026.06 | 69.2 | — | |
| Upper BoundBase Model=LLaVA-NeXT-7B, Token Retention Budget=unpruned2026.04 | 67.4 | — | |
| CLASPBase Model=LLaVA-NeXT-7B, Token Retention Budget=640 Tokens2026.04 | 62.8 | — | |
| SparseVLMBase Model=LLaVA-NeXT-7B, Token Retention Budget=640 Tokens2026.04 | 62.2 | — | |
| TaiChiLLM=Gemma-2B, Resolution=336, Zero-shot evaluation=true2026.02 | 61.9 | — | |
| CLASPBase Model=LLaVA-NeXT-7B, Token Retention Budget=320 Tokens2026.04 | 61.2 | — | |
| SparseVLMBase Model=LLaVA-NeXT-7B, Token Retention Budget=320 Tokens2026.04 | 60.6 | — | |
| CLASPBase Model=LLaVA-NeXT-7B, Token Retention Budget=160 Tokens2026.04 | 59.8 | — | |
| MobileVLMLLM=MLLaMA 2.7B, Resolution=336, Zero-shot evaluation=true2026.02 | 59.6 | — | |
| SparseVLMBase Model=LLaVA-NeXT-7B, Token Retention Budget=160 Tokens2026.04 | 56.9 | — | |
| FastVToken Retention Ratio=12.5%, Backbone=Qwen2.5-VL-7B2026.02 | 53.6 | — | |
| InstructBLIPLLM=Vicuna-7B, Resolution=224, Zero-shot evaluation=true2026.02 | 36 | — | |
| CoLLaVOParameters=7B2024.12 | — | 83 | |
| CREMModel Size=2B, Training Strategy=Unified framework2026.02 | — | 72.5 | |
| CREMModel Size=7B, Training Strategy=Unified framework2026.02 | — | 80.5 | |
| CREM_GModel Size=2B, Training Strategy=Fine-tuned on ShareGPT-4V2026.02 | — | 73.1 | |
| CREM_GModel Size=7B, Training Strategy=Fine-tuned on ShareGPT-4V2026.02 | — | 80.7 | |
| CREM_RModel Size=2B, Training Strategy=Trained on MMEB2026.02 | — | 64.3 | |
| CREM_RModel Size=7B, Training Strategy=Trained on MMEB2026.02 | — | 77.3 | |
| DeepSeek-VLParameters=7B2024.12 | — | 73.2 | |
| EagleParameters=8B2024.12 | — | 75.9 | |
| FreeCorrectionbackbone=Lumina-DiMOO2026.02 | — | 60.7 | |
| Lumina-DiMOOgeneration step=64, generated sequence length=2562026.02 | — | 58.7 | |
| Lumina-DiMOOBase Model=Lumina-DiMOO, Reproduction Status=Reported, Method Variation=Original2026.05 | — | 84.5 | |
| Lumina-DiMOOBase Model=Lumina-DiMOO, Reproduction Status=Reproduced, Method Variation=Baseline2026.05 | — | 84.9 | |
| Lumina-DiMOO (ReMDM)2026.02 | — | 57.8 | |
| Lumina-DiMOO + OursBase Model=Lumina-DiMOO, Reproduction Status=Reproduced, Method Variation=With Mask Prior Suppression and Monotonic RoPE Scaling2026.05 | — | 85 | |
| MeteorParameters=7B2024.12 | — | 82.9 | |
| MMaDABase Model=MMaDA, Reproduction Status=Reported, Method Variation=Original2026.05 | — | 68.5 | |
| MMaDABase Model=MMaDA, Reproduction Status=Reproduced, Method Variation=Baseline2026.05 | — | 44.5 | |
| MMaDA + OursBase Model=MMaDA, Reproduction Status=Reproduced, Method Variation=With Mask Prior Suppression and Monotonic RoPE Scaling2026.05 | — | 44.5 | |
| MoAIParameters=7B2024.12 | — | 79.3 | |
| MoVAParameters=7B2024.12 | — | 81.3 | |
| OmniFusionParameters=7B2024.12 | — | 69 | |
| Qwen2-VLModel Size=2B, Training Strategy=Original2026.02 | — | 72.3 | |
| Qwen2-VLModel Size=7B, Training Strategy=Original2026.02 | — | 80.9 | |
| RecursiveVLMTraining Dataset=Data1, Train Steps=2, Eval Step=12026.02 | — | 73.97 | |
| RecursiveVLMTraining Dataset=Data1, Train Steps=2, Eval Step=22026.02 | — | 76.63 | |
| RecursiveVLMTraining Dataset=Data2, Train Steps=2, Eval Step=12026.02 | — | 68.56 | |
| RecursiveVLMTraining Dataset=Data2, Train Steps=2, Eval Step=22026.02 | — | 74.31 | |
| Standard TransformerTraining Dataset=Data1, Train Steps=1, Eval Step=12026.02 | — | 67.01 | |
| Standard TransformerTraining Dataset=Data2, Train Steps=1, Eval Step=12026.02 | — | 65.98 | |
| Vanilla recursionTraining Dataset=Data1, Train Steps=2, Eval Step=12026.02 | — | 60.65 | |
| Vanilla recursionTraining Dataset=Data1, Train Steps=2, Eval Step=22026.02 | — | 59.36 | |
| Vanilla recursion w/ RMSNormTraining Dataset=Data1, Train Steps=2, Eval Step=12026.02 | — | 63.06 | |
| Vanilla recursion w/ RMSNormTraining Dataset=Data1, Train Steps=2, Eval Step=22026.02 | — | 60.48 | |
| VLsIParameters=2B2024.12 | — | 81.7 | |
| VLsIParameters=7B2024.12 | — | 86.3 |