Video Question Answering on EgoSchema, MVBench, Next-QA, Video-MME (test)
100Average AccuracyVanilla
Evaluation Results
| Method | Links | |
|---|---|---|
| VanillaBase Model=LLaVA-NeXT-Video-7B, Retained Tokens=Full, Pruning Rate=0%2026.01 | 100 | |
| ViTCoPBase Model=LLaVA-NeXT-Video-7B, Retained Tokens=128, Pruning Rate=88.9%2026.01 | 97.7 | |
| SparseVLMBase Model=LLaVA-NeXT-Video-7B, Retained Tokens=128, Pruning Rate=88.9%2026.01 | 95.1 | |
| VisionZipBase Model=LLaVA-NeXT-Video-7B, Retained Tokens=128, Pruning Rate=88.9%2026.01 | 90.3 | |
| FastVBase Model=LLaVA-NeXT-Video-7B, Retained Tokens=128, Pruning Rate=88.9%2026.01 | 88.6 | |
| PyramidDropBase Model=LLaVA-NeXT-Video-7B, Retained Tokens=128, Pruning Rate=88.9%2026.01 | 86.4 |