Video Understanding on EgoSchema 500-subset
55.4Overall ScoreLLaVA-Video-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLaVA-Video-7BVisual Token Budget=All 2,704 Visual Tokens, Evaluation Mode=16-frame evaluation, Base Model=LLaVA-Video-7B2026.07 | 55.4 | 100 | |
| AnchorPruneVisual Token Budget=Retain 1,024 Tokens, Evaluation Mode=16-frame evaluation, Base Model=LLaVA-Video-7B2026.07 | 55 | 98.3 | |
| DivPruneVisual Token Budget=Retain 1,024 Tokens, Evaluation Mode=16-frame evaluation, Base Model=LLaVA-Video-7B, Source=CVPR’252026.07 | 53.2 | 96.1 | |
| AnchorPruneVisual Token Budget=Retain 512 Tokens, Evaluation Mode=16-frame evaluation, Base Model=LLaVA-Video-7B2026.07 | 53 | 94.1 | |
| FastVVisual Token Budget=Retain 1,024 Tokens, Evaluation Mode=16-frame evaluation, Base Model=LLaVA-Video-7B, Source=ECCV’242026.07 | 52.8 | 97.7 | |
| CDPrunerVisual Token Budget=Retain 1,024 Tokens, Evaluation Mode=16-frame evaluation, Base Model=LLaVA-Video-7B, Source=NeurIPS’252026.07 | 52.6 | 96.8 | |
| DivPruneVisual Token Budget=Retain 512 Tokens, Evaluation Mode=16-frame evaluation, Base Model=LLaVA-Video-7B, Source=CVPR’252026.07 | 52 | 93.4 | |
| CDPrunerVisual Token Budget=Retain 512 Tokens, Evaluation Mode=16-frame evaluation, Base Model=LLaVA-Video-7B, Source=NeurIPS’252026.07 | 51.4 | 91.7 | |
| FastVVisual Token Budget=Retain 512 Tokens, Evaluation Mode=16-frame evaluation, Base Model=LLaVA-Video-7B, Source=ECCV’242026.07 | 50.2 | 92.4 |