Multi-modal Benchmarking on MMBench Chinese
85.4AccuracyInternVL3-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL3-8BBackbone=InternVL3-8B, Retained Tokens=1280, Reduction Ratio=0%2026.06 | 85.4 | |
| DARTBackbone=InternVL3-8B, Retained Tokens=256, Reduction Ratio=80.0%2026.06 | 83.2 | |
| ERABackbone=InternVL3-8B, Retained Tokens=256, Reduction Ratio=80.0%2026.06 | 83 | |
| VisionZipBackbone=InternVL3-8B, Retained Tokens=256, Reduction Ratio=80.0%2026.06 | 81.5 | |
| DARTBackbone=InternVL3-8B, Retained Tokens=128, Reduction Ratio=90.0%2026.06 | 80.9 | |
| DivPruneBackbone=InternVL3-8B, Retained Tokens=256, Reduction Ratio=80.0%2026.06 | 80.8 | |
| ERABackbone=InternVL3-8B, Retained Tokens=128, Reduction Ratio=90.0%2026.06 | 79.8 | |
| DivPruneBackbone=InternVL3-8B, Retained Tokens=128, Reduction Ratio=90.0%2026.06 | 78 | |
| VisionZipBackbone=InternVL3-8B, Retained Tokens=128, Reduction Ratio=90.0%2026.06 | 76.5 | |
| HiPruneBackbone=LLaVA-NeXT-13B, Token Num=6402025.08 | 65.3 | |
| HiPruneBackbone=LLaVA-NeXT-13B, Token Num=3202025.08 | 64.9 | |
| HiPrune++Backbone=LLaVA-NeXT-13B, Token Num=6402025.08 | 64.8 | |
| LLaVA-1.5-13BToken Num=5762025.08 | 63.5 | |
| HiPrune++Backbone=LLaVA-NeXT-13B, Token Num=3202025.08 | 63.4 | |
| HiPruneBackbone=LLaVA-1.5-13B, Token Num=1282025.08 | 63.1 | |
| HiPrune++Backbone=LLaVA-1.5-13B, Token Num=1282025.08 | 62.8 | |
| HiPruneBackbone=LLaVA-1.5-13B, Token Num=1922025.08 | 62.5 | |
| HiPrune++Backbone=LLaVA-1.5-13B, Token Num=1922025.08 | 62.5 | |
| PDropBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 62.4 | |
| VanillaBase Model=LLaVA-1.5-13B, Retain Tokens=576, Retention Ratio=100%2026.06 | 62.3 | |
| HiPruneBackbone=LLaVA-NeXT-13B, Token Num=1602025.08 | 61.3 | |
| LLaVA-NeXT-13BToken Num=28802025.08 | 61.2 | |
| SparseVLMBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 61 | |
| CLSEBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 60.8 | |
| HiPrune++Backbone=LLaVA-NeXT-13B, Token Num=1602025.08 | 60.7 | |
| CLSEBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 59.5 | |
| HiPruneBackbone=LLaVA-1.5-13B, Token Num=642025.08 | 59.2 | |
| PDropBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 59.2 | |
| LLaVA-v1.5#Vision Tokens=5762026.03 | 58.3 | |
| FMVR-LLaVA#Vision Tokens=362026.03 | 58.3 | |
| HiPrune++Backbone=LLaVA-1.5-13B, Token Num=642025.08 | 58.3 | |
| FiCoCo-VBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 58.3 | |
| FMVR-LLaVA#Vision Tokens=5762026.03 | 58 | |
| FMVR-LLaVA#Vision Tokens=1442026.03 | 57.6 | |
| FMVR-LLaVA#Vision Tokens=92026.03 | 57.5 | |
| DART#Vision Tokens=1282026.03 | 57.3 | |
| VisPruner#Vision Tokens=1282026.03 | 57.3 | |
| MQT-LLaVA#Vision Tokens=1442026.03 | 57.2 | |
| VisionZip#Vision Tokens=1922026.03 | 57 | |
| SparseVLM#Vision Tokens=1922026.03 | 56.7 | |
| CLSEBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 56.7 | |
| PyramidDrop#Vision Tokens=1922026.03 | 56.3 | |
| M3#Vision Tokens=1442026.03 | 56.3 | |
| FiCoCo-VBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 55.9 | |
| SparseVLMBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 55.8 | |
| FastV#Vision Tokens=1922026.03 | 55.4 | |
| CDPruner#Vision Tokens=1282026.03 | 55 | |
| DivPrune#Vision Tokens=1282026.03 | 54.8 | |
| SparseVLMBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 54.8 | |
| FMVR-LLaVA#Vision Tokens=12026.03 | 53.4 | |
| Prumerge+#Vision Tokens=1442026.03 | 53.2 | |
| TRIM#Vision Tokens=1282026.03 | 52.3 | |
| FastVBase Model=LLaVA-1.5-13B, Retain Tokens=192, Retention Ratio=↓ 66.7%2026.06 | 51.2 | |
| PDropBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 50.7 | |
| FiCoCo-VBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 49.4 | |
| FastVBase Model=LLaVA-1.5-13B, Retain Tokens=128, Retention Ratio=↓ 77.8%2026.06 | 48.8 | |
| FastVBase Model=LLaVA-1.5-13B, Retain Tokens=64, Retention Ratio=↓ 88.9%2026.06 | 42.1 | |
| InstructBLIP#Vision Tokens=322026.03 | 23.7 | |
| Qwen-VL#Vision Tokens=2562026.03 | 7.4 |