Image Captioning on Nocaps (CIDEr)
83.7CIDErHiMAP
Evaluation Results
| Method | Links | |
|---|---|---|
| HiMAPModel=LLaVA-13B, Ratio=33%2025.03 | 83.7 | |
| BaselineModel=LLaVA-13B, Ratio=100%2025.03 | 82.8 | |
| FastVModel=LLaVA-13B, Ratio=53%2025.03 | 81.9 | |
| BaselineModel=LLaVA-7B, Ratio=100%2025.03 | 78.8 | |
| HiMAPModel=LLaVA-7B, Ratio=34%2025.03 | 78.7 | |
| FastVModel=LLaVA-7B, Ratio=54%2025.03 | 78.6 | |
| D²PrunerBackbone=InternVL-2.5-8B, Token Retention Rate=10%2025.12 | 1.17 | |
| VanillaBackbone=InternVL-2.5-8B, Token Retention Rate=100%2025.12 | 1.16 | |
| D²PrunerBackbone=InternVL-2.5-8B, Token Retention Rate=25%2025.12 | 1.16 | |
| FastVBackbone=InternVL-2.5-8B, Token Retention Rate=25%2025.12 | 1.14 | |
| DARTBackbone=InternVL-2.5-8B, Token Retention Rate=25%2025.12 | 1.11 | |
| DivPruneBackbone=InternVL-2.5-8B, Token Retention Rate=25%2025.12 | 1.11 | |
| FastVBackbone=InternVL-2.5-8B, Token Retention Rate=10%2025.12 | 1.02 | |
| DivPruneBackbone=InternVL-2.5-8B, Token Retention Rate=10%2025.12 | 1 | |
| DARTBackbone=InternVL-2.5-8B, Token Retention Rate=10%2025.12 | 0.9 |