Multimodal Question Answering on MMQA
70.5AccuracyOriginal Model
Evaluation Results
| Method | Links | |
|---|---|---|
| Original ModelBackbone=LLaVA-1.5-13B, Retention Ratio=1.02025.12 | 70.5 | |
| TrimTokenator-LCBackbone=LLaVA-1.5-13B, Retention Ratio=0.22025.12 | 69 | |
| VisionZipBackbone=LLaVA-1.5-13B, Retention Ratio=0.22025.12 | 67.5 | |
| TrimTokenator-LCBackbone=Yi-VL-6B, Retention Ratio=0.22025.12 | 67.5 | |
| Original ModelBackbone=LLaVA-1.5-7B, Retention Ratio=1.02025.12 | 67 | |
| SparseVLMBackbone=LLaVA-1.5-13B, Retention Ratio=0.22025.12 | 67 | |
| TrimTokenatorBackbone=LLaVA-1.5-13B, Retention Ratio=0.22025.12 | 67 | |
| Original ModelBackbone=Yi-VL-6B, Retention Ratio=1.02025.12 | 67 | |
| FastVBackbone=LLaVA-1.5-13B, Retention Ratio=0.22025.12 | 66.5 | |
| CATPBackbone=LLaVA-1.5-13B, Retention Ratio=0.22025.12 | 66.5 | |
| Original ModelBase Model=InternVL-Chat-ViT-6B-Vicuna-13B2025.12 | 66 | |
| VTWBackbone=LLaVA-1.5-13B, Retention Ratio=0.22025.12 | 66 | |
| DivPruneBackbone=LLaVA-1.5-13B, Retention Ratio=0.22025.12 | 66 | |
| DivPruneBackbone=Yi-VL-6B, Retention Ratio=0.22025.12 | 66 | |
| VTWBackbone=Yi-VL-6B, Retention Ratio=0.22025.12 | 65.5 | |
| TrimTokenatorBackbone=Yi-VL-6B, Retention Ratio=0.22025.12 | 64.5 | |
| SparseVLMBackbone=Yi-VL-6B, Retention Ratio=0.22025.12 | 64 | |
| CATPBackbone=Yi-VL-6B, Retention Ratio=0.22025.12 | 63.5 | |
| TrimTokenator-LCBase Model=InternVL-Chat-ViT-6B-Vicuna-13B2025.12 | 63 | |
| FastVBackbone=Yi-VL-6B, Retention Ratio=0.22025.12 | 63 | |
| VisionZipBackbone=Yi-VL-6B, Retention Ratio=0.22025.12 | 63 | |
| DivPruneBase Model=InternVL-Chat-ViT-6B-Vicuna-13B2025.12 | 62.5 | |
| TrimTokenator-LCBackbone=LLaVA-1.5-7B, Retention Ratio=0.22025.12 | 62.5 | |
| TrimTokenatorBase Model=InternVL-Chat-ViT-6B-Vicuna-13B2025.12 | 62 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Retention Ratio=0.22025.12 | 62 | |
| DivPruneBackbone=LLaVA-1.5-7B, Retention Ratio=0.22025.12 | 62 | |
| TrimTokenatorBackbone=LLaVA-1.5-7B, Retention Ratio=0.22025.12 | 61.5 | |
| FastVBackbone=LLaVA-1.5-7B, Retention Ratio=0.22025.12 | 61 | |
| VisionZipBackbone=LLaVA-1.5-7B, Retention Ratio=0.22025.12 | 61 | |
| SparseVLMBase Model=InternVL-Chat-ViT-6B-Vicuna-13B2025.12 | 60.5 | |
| VTWBackbone=LLaVA-1.5-7B, Retention Ratio=0.22025.12 | 60.5 | |
| CATPBackbone=LLaVA-1.5-7B, Retention Ratio=0.22025.12 | 60.5 | |
| VTWBase Model=InternVL-Chat-ViT-6B-Vicuna-13B2025.12 | 59.5 | |
| VisionZipBase Model=InternVL-Chat-ViT-6B-Vicuna-13B2025.12 | 58.5 | |
| FastVBase Model=InternVL-Chat-ViT-6B-Vicuna-13B2025.12 | 58 | |
| CATPBase Model=InternVL-Chat-ViT-6B-Vicuna-13B2025.12 | 58 |