Long-form Video Understanding on LongVideoBench
60.4Overall ScoreQwen2.5-VL-128
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-VL-128Input Frames=128, Token Retain Ratio (r)=100% (Full Performance)2026.05 | 60.4 | 56.2 | 65.1 | |
| ST-SimDiff-128Input Frames=128, Token Retain Ratio (r)=50%2026.05 | 59.8 | 54.9 | 65.3 | |
| Qwen2.5-VL-64Input Frames=64, Token Retain Ratio (r)=100% (Full Performance)2026.05 | 59.2 | 54.2 | 64.8 | |
| ST-SimDiff-128Input Frames=128, Token Retain Ratio (r)=30%2026.05 | 58.6 | 53.1 | 65 | |
| ST-SimDiff-64Input Frames=64, Token Retain Ratio (r)=50%2026.05 | 58.4 | 54.2 | 63.2 | |
| ST-SimDiff-64Input Frames=64, Token Retain Ratio (r)=30%2026.05 | 56.8 | 52.2 | 62.1 | |
| ST-SimDiffBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=50%2026.05 | 56.5 | 52.3 | 61.3 | |
| NVILA-VideoBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=100% (Upper Bound)2026.05 | 56.3 | — | — | |
| ST-SimDiffBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=30%2026.05 | 55.2 | 51.7 | 59.2 | |
| FrameFusionBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=30%2026.05 | 54.9 | 51.3 | 59.3 | |
| FrameFusionBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=50%2026.05 | 54.8 | 51 | 59.2 | |
| VisionZipBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=50%2026.05 | 54.4 | 50.4 | 58.9 | |
| FastVBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=50%2026.05 | 53.9 | 49.5 | 58.8 | |
| PruMergeBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=50%2026.05 | 53.9 | 49.7 | 58.7 | |
| PruMergeBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=30%2026.05 | 53.4 | 49.3 | 58.1 | |
| FastVBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=30%2026.05 | 53 | 50.8 | 55.6 | |
| FasterVLMBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=30%2026.05 | 53 | 48.7 | 57.8 | |
| FasterVLMBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=50%2026.05 | 53 | 48.5 | 58.1 | |
| VisionZipBase Model=NVILA-Video-8B, Input Frames=64, Token Retain Ratio=30%2026.05 | 50.9 | 46.3 | 56.2 |