Omni-modal dense video captioning on LongVALE 1.0 (test)
2.8SODA_cLongVALE-LLM (7B)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LongVALE-LLM (7B)A&V=true, TU=true2024.11 | 2.8 | 7.9 | 4.7 | 5.6 | |
| VTimeLLM (7B)A&V=false, TU=true2024.11 | 2.4 | 0.2 | 2 | 1 | |
| TimeChat (7B)A&V=false, TU=true2024.11 | 1.6 | 0.1 | 1.4 | 1.2 | |
| VideoChat (7B)A&V=false, TU=false2024.11 | 0.7 | 0.2 | 0.9 | 0.5 | |
| VideoChatGPT (7B)A&V=false, TU=false2024.11 | 0.7 | 0.1 | 0.8 | 0.4 | |
| VideoLLaMA (7B)A&V=true, TU=false2024.11 | 0.6 | 0.6 | 0.9 | 0.9 | |
| PandaGPT (7B)A&V=true, TU=false2024.11 | 0.5 | 0 | 0.6 | 0.6 | |
| NEXT-GPT (7B)A&V=true, TU=false2024.11 | 0.2 | 0.1 | 0.3 | 0.4 |