Multimodal Question Answering on MMBench CN
84.6AccuracyQwen3-VL-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VL-8BRetained Tokens=1024 Tokens (100%)2026.07 | 84.6 | |
| MergeMixbaseline=SFT Vision2025.10 | 81.18 | |
| VisionThink-7B2025.10 | 81.01 | |
| SFT Vision2025.10 | 81.01 | |
| Qwen2.5-VL-Ins-7B2025.10 | 80.41 | |
| Qwen2.5-VL-7BToken Budget=100%2025.08 | 80.1 | |
| CDPrunerRetained Tokens=256 Tokens (↓ 75.0%)2026.07 | 80 | |
| EADPRetained Tokens=512 Tokens (↓ 50.0%)2026.07 | 79.7 | |
| HiPruneBase Model=Qwen2.5-VL-7B, Token Budget=33.3%2025.08 | 79.5 | |
| DivPruneRetained Tokens=512 Tokens (↓ 50.0%)2026.07 | 79.4 | |
| CDPrunerRetained Tokens=512 Tokens (↓ 50.0%)2026.07 | 79.3 | |
| HiPrune++Base Model=Qwen2.5-VL-7B, Token Budget=33.3%2025.08 | 79.2 | |
| EADPRetained Tokens=256 Tokens (↓ 75.0%)2026.07 | 78.9 | |
| DivPruneRetained Tokens=256 Tokens (↓ 75.0%)2026.07 | 78.8 | |
| EADPRetained Tokens=128 Tokens (↓ 87.5%)2026.07 | 78.4 | |
| HiPruneBase Model=Qwen2.5-VL-7B, Token Budget=22.2%2025.08 | 77.6 | |
| CDPrunerRetained Tokens=128 Tokens (↓ 87.5%)2026.07 | 77.5 | |
| HiPrune++Base Model=Qwen2.5-VL-7B, Token Budget=22.2%2025.08 | 77 | |
| DivPruneRetained Tokens=128 Tokens (↓ 87.5%)2026.07 | 76.6 | |
| HiPruneBase Model=Qwen2.5-VL-7B, Token Budget=11.1%2025.08 | 73.5 | |
| HiPrune++Base Model=Qwen2.5-VL-7B, Token Budget=11.1%2025.08 | 73.3 | |
| Qwen2.5-VL-3BToken Budget=100%2025.08 | 73 | |
| QMoSLoRAModel=InternLM2 + ViT, Initialization=Kaiming uniform, Quantization=4-bit2024.06 | 72.6 | |
| HiPruneBase Model=Qwen2.5-VL-3B, Token Budget=33.3%2025.08 | 71.8 | |
| QMoSLoRAModel=InternLM2 + ViT, Initialization=Orthogonal, Quantization=4-bit2024.06 | 71.2 | |
| HiPrune++Base Model=Qwen2.5-VL-3B, Token Budget=33.3%2025.08 | 70.9 | |
| HiPruneBase Model=Qwen2.5-VL-3B, Token Budget=22.2%2025.08 | 69.1 | |
| QLoRAModel=InternLM2 + ViT, Quantization=4-bit2024.06 | 68.9 | |
| HiPrune++Base Model=Qwen2.5-VL-3B, Token Budget=22.2%2025.08 | 68.9 | |
| MoSLoRAModel=LLaMA-3 + ViT, Initialization=Orthogonal2024.06 | 68.2 | |
| LoRAModel=LLaMA-3 + ViT2024.06 | 67.8 | |
| MoSLoRAModel=LLaMA-3 + ViT, Initialization=Kaiming uniform2024.06 | 67.5 | |
| HiPruneBase Model=Qwen2.5-VL-3B, Token Budget=11.1%2025.08 | 65.1 | |
| HiPrune++Base Model=Qwen2.5-VL-3B, Token Budget=11.1%2025.08 | 64.9 | |
| CoVFTBackbone=LLaVA-1.5-13B2026.03 | 64.52 | |
| LLaVA-1.5Backbone=LLaVA-1.5-13B2026.03 | 63.6 | |
| FreezeBackbone=LLaVA-1.5-13B2026.03 | 63.57 | |
| Full fine-tuningBackbone=LLaVA-1.5-13B2026.03 | 63.49 | |
| BitFitBackbone=LLaVA-1.5-13B2026.03 | 62.54 | |
| CoVFTBackbone=LLaVA-1.5-7B2026.03 | 60.4 | |
| FreezeBackbone=LLaVA-1.5-7B2026.03 | 60.3 | |
| Full fine-tuningBackbone=LLaVA-1.5-7B2026.03 | 59.88 | |
| BitFitBackbone=LLaVA-1.5-7B2026.03 | 59.02 | |
| LLaVA-1.5Backbone=LLaVA-1.5-7B2026.03 | 58.3 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 58.2 | |
| VPTBackbone=LLaVA-1.5-7B2026.03 | 58.16 | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B, Retained Tokens=5762026.06 | 58.1 | |
| SVPTBackbone=LLaVA-1.5-7B2026.03 | 57.9 | |
| LoRABackbone=LLaVA-1.5-7B2026.03 | 57.56 | |
| DARTBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 57.3 | |
| SPAREBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 56.4 | |
| CDPrunerBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 55.2 | |
| PruMerge+Backbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 54.6 | |
| SPAREBackbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 54 | |
| DARTBackbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 53.9 | |
| CDPrunerBackbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 53.4 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 52.6 | |
| PruMerge+Backbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 52.3 | |
| SPAREBackbone=LLaVA-1.5-7B, Retained Tokens=322026.06 | 50.3 | |
| CDPrunerBackbone=LLaVA-1.5-7B, Retained Tokens=322026.06 | 49.6 | |
| DARTBackbone=LLaVA-1.5-7B, Retained Tokens=322026.06 | 48.8 |