Multimodal Question Answering on MMBench (dev)
77.3AccuracyQwen
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| QwenBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=100%2025.08 | 77.3 | 100 | |
| HiPrune++Backbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=33.3%2025.08 | 76 | 98.7 | |
| HiPruneBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=33.3%2025.08 | 75.9 | 98.7 | |
| VisionZipBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=33.3%2025.08 | 74.9 | 97.7 | |
| FastVBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=33.3%2025.08 | 74.4 | 97.4 | |
| HiPrune++Backbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=22.2%2025.08 | 74.2 | 97.1 | |
| HiPruneBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=22.2%2025.08 | 73.7 | 97.1 | |
| VisionZipBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=22.2%2025.08 | 73.5 | 96.2 | |
| FastVBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=22.2%2025.08 | 72.4 | 95.9 | |
| HiPrune++Backbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=11.1%2025.08 | 70.5 | 93 | |
| HiPruneBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=11.1%2025.08 | 69.6 | 93 | |
| VisionZipBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=11.1%2025.08 | 67.8 | 91.5 | |
| FastVBackbone=Qwen2.5-VL-3B-Instruct, Token Retain Ratio=11.1%2025.08 | 56.2 | 86.4 |