Video Understanding on Average TGIF, MSVD, MSRVTT
100Accuracy Retention (%)Vanilla
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VanillaBackbone=Video-LLaVA-7B, Original visual tokens=2048, Retained visual tokens=256, Reduction ratio=87.5%2026.05 | 100 | — | — | 100 | |
| LRCPBackbone=Video-LLaVA-7B, Original visual tokens=2048, Retained visual tokens=256, Reduction ratio=87.5%2026.05 | 97.8 | — | — | 99.3 | |
| VisionZipBackbone=Video-LLaVA-7B, Original visual tokens=2048, Retained visual tokens=256, Reduction ratio=87.5%2026.05 | 94.4 | — | — | 98.2 | |
| PDropBackbone=Video-LLaVA-7B, Original visual tokens=2048, Retained visual tokens=256, Reduction ratio=87.5%2026.05 | 82.4 | — | — | 94.4 |