Long-Video Understanding on LongVideoBench 8s~60m
66.7ScoreGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oModel Type=Transformer, Size=–2026.02 | 66.7 | |
| Qwen2.5+FlexSelectModel Type=Transformer, Size=72B2026.02 | 66.4 | |
| Nemotron-Nano-V2 VL + All layer reductionModel Type=Hybrid, Size=12B2026.02 | 66.04 | |
| Qwen3 VL + All layer reductionModel Type=Transformer, Size=8B2026.02 | 64.32 | |
| Gemini-1.5-ProModel Type=Transformer, Size=–2026.02 | 64 | |
| SF-LLaVA-1.5Model Type=Transformer, Size=7B2026.02 | 62.5 | |
| Qwen2.5 VL+FlexSelectModel Type=Transformer, Size=7B2026.02 | 62.4 | |
| Oryx-1.5Model Type=Transformer, Size=34B2026.02 | 62 | |
| LLaVA-Video+FlexSelectModel Type=Transformer, Size=7B2026.02 | 61.9 | |
| ViLAMPModel Type=Transformer, Size=7B2026.02 | 61.2 | |
| Qwen2.5 VL+SparseVILAModel Type=Transformer, Size=7B2026.02 | 60.1 | |
| VideoLLaMA3Model Type=Transformer, Size=7B2026.02 | 59.8 | |
| ApolloModel Type=Transformer, Size=7B2026.02 | 58.5 | |
| NVILAModel Type=Transformer, Size=8B2026.02 | 57.7 | |
| MLLM-FSModel Type=Transformer, Size=7B2026.02 | 57 | |
| LLaVA-OnevisionModel Type=Transformer, Size=7B2026.02 | 56.4 | |
| Qwen2-VLModel Type=Transformer, Size=7B2026.02 | 55.6 |