Omni-modal temporal video grounding on LongVALE 1.0 (test)
15.7R@0.3LongVALE-LLM (7B)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LongVALE-LLM (7B)A&V=true, TU=true2024.11 | 15.7 | 8.6 | 3.9 | 11 | |
| VTimeLLM (7B)A&V=false, TU=true2024.11 | 7.5 | 3.4 | 1.3 | 6.4 | |
| TimeChat (7B)A&V=false, TU=true2024.11 | 5.8 | 2.6 | 1.1 | 5.2 | |
| VideoChatGPT (7B)A&V=false, TU=false2024.11 | 4.9 | 2 | 0.9 | 5 | |
| NEXT-GPT (7B)A&V=true, TU=false2024.11 | 4.3 | 1.9 | 0.7 | 4 | |
| VideoLLaMA (7B)A&V=true, TU=false2024.11 | 2.5 | 1.1 | 0.3 | 1.9 | |
| PandaGPT (7B)A&V=true, TU=false2024.11 | 2.5 | 1 | 0.3 | 2.2 | |
| VideoChat (7B)A&V=false, TU=false2024.11 | 2.2 | 0.9 | 0.4 | 3 |