Long Video Understanding on LV-Bench (test)
21.3ERMovieChat
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| MovieChatSize=7B, Input=~10k f2024.11 | 21.3 | 23.1 | 25.9 | 22.3 | 24 | 17.2 | 22.5 | |
| TimeChatSize=7B, Input=96f2024.11 | 21.9 | 21.7 | 25.9 | 22.7 | 25 | 24.1 | 22.3 | |
| LWMSize=7B, Input=~4k f2024.11 | 24.7 | 24.8 | 26.5 | 28.6 | 30.5 | 22.4 | 25.5 | |
| PLLaVASize=34B, Input=16f2024.11 | 25 | 24.9 | 26.2 | 21.4 | 30 | 25.9 | 27 | |
| LLAMA-VIDSize=13B, Input=~10k f2024.11 | 25.4 | 21.7 | 23.4 | 26.4 | 26.5 | 17.2 | 23.9 | |
| GPT-4oInput=10f2024.11 | 26.5 | 23.7 | 28.3 | 21.4 | 28 | 32.8 | 26.1 | |
| DynFocusSize=7B, Input=200f, L=25, K/L=0.82024.11 | 27.9 | 30.3 | 31.2 | 25.4 | 31.8 | 32.8 | 30.4 | |
| DynFocusSize=7B, Input=200f, L=60, K/L=0.62024.11 | 29.9 | 33.7 | 35.1 | 25.5 | 33.3 | 26.2 | 32.6 | |
| LLaVA-NeXTSize=34B, Input=32f2024.11 | 30.1 | 31.2 | 34.1 | 31.4 | 35 | 27.6 | 32.2 | |
| DynFocusSize=7B, Input=200f, L=80, K/L=0.42024.11 | 31.1 | 33.5 | 31.6 | 28.6 | 33.8 | 24.1 | 31.8 | |
| DynFocusSize=7B, Input=200f, L=50, K/L=0.82024.11 | 31.8 | 28.6 | 31.8 | 32.6 | 27.2 | 35.3 | 34.4 | |
| DynFocusSize=7B, Input=200f, L=70, K/L=0.42024.11 | 31.8 | 33.5 | 32.6 | 28.7 | 34.8 | 31.3 | 32.9 | |
| Gemini 1.5 ProInput=~4k f2024.11 | 32.1 | 30.9 | 39.3 | 31.8 | 27 | 32.8 | 33.1 |