Multimodal Question Answering on MMBench-CN (dev)
73AccuracyQwen
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| QwenBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=100%2025.08 | 73 | 100 | |
| HiPruneBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=33.3%2025.08 | 71.4 | 98.7 | |
| HiPrune++Backbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=33.3%2025.08 | 71.1 | 98.7 | |
| FastVBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=33.3%2025.08 | 70.6 | 97.4 | |
| VisionZipBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=33.3%2025.08 | 69.8 | 97.7 | |
| HiPrune++Backbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=22.2%2025.08 | 69.4 | 97.1 | |
| FastVBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=22.2%2025.08 | 69.2 | 95.9 | |
| HiPruneBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=22.2%2025.08 | 69.1 | 97.1 | |
| VisionZipBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=22.2%2025.08 | 67.4 | 96.2 | |
| HiPruneBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=11.1%2025.08 | 65.4 | 93 | |
| HiPrune++Backbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=11.1%2025.08 | 64.7 | 93 | |
| VisionZipBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=11.1%2025.08 | 63.3 | 91.5 | |
| FastVBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=11.1%2025.08 | 60.7 | 86.4 |