Long-form Video Understanding on LVU 1.0 (test)
78.4Director AccuracyHierarQ
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| HierarQLLM finetuning=true2025.03 | 78.4 | — | — | — | — | — | — | 67.9 | 71.9 | 61.9 | 70 | |
| HierarQLLM finetuning=false2025.03 | 76.6 | — | — | — | — | — | — | 66.2 | 71.1 | 59.2 | 68.3 | |
| MA-LMM2025.03 | 74.6 | — | — | — | — | — | — | 61.1 | 70.4 | 51.9 | 64.5 | |
| Movies2Scene2025.03 | 70.9 | — | — | — | — | — | — | 55.9 | 53.7 | 57.8 | 59.6 | |
| S52025.03 | 67.3 | — | — | — | — | — | — | 65.4 | 51.3 | 48 | 58 | |
| VideoMamba2025.03 | 67.3 | — | — | — | — | — | — | 65.2 | 53 | 48.2 | 58.4 | |
| TranS4mer2025.03 | 63.9 | — | — | — | — | — | — | 55.9 | 46.9 | 45.5 | 53.1 | |
| VIS4mer2025.03 | 62.6 | — | — | — | — | — | — | 54.7 | 48.8 | 44.8 | 52.7 | |
| Orthoformer2025.03 | 55.1 | — | — | — | — | — | — | 55.8 | 47 | 43.4 | 50.3 | |
| Object Transformerpre-training=MovieClip, input_span=60 seconds2021.06 | 51.2 | 1.33 | 53.1 | 39.4 | 56.9 | 0.23 | 3.55 | 54.6 | 34.5 | 39.1 | — | |
| Obj-T4mer2025.03 | 47.7 | — | — | — | — | — | — | 52.7 | 36.3 | 37.8 | 43.6 | |
| VideoBERTvariant=vision-only, pre-training=MovieClip2021.06 | 47.3 | 2.22 | 52.8 | 37.9 | 54.9 | 0.32 | 4.46 | 51.9 | 38.5 | 36.1 | — | |
| VideoBERT2025.03 | 47.3 | — | — | — | — | — | — | 51.1 | 38.5 | 36.1 | 43.3 | |
| R101-SlowFast+NLbackbone=ResNet-101, frames=128, pre-training=Kinetics-600 + AVA2021.06 | 44.9 | 2.44 | 52.4 | 35.8 | 54.7 | 0.386 | 3.77 | 53 | 36.3 | 52.5 | — |