Omni-modal segment captioning on LongVALE 1.0 (test)
0.224ROUGE-LLongVALE-LLM (7B)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LongVALE-LLM (7B)A&V=true, TU=true2024.11 | 0.224 | 20.3 | 0.109 | |
| TimeChat (7B)A&V=false, TU=true2024.11 | 0.161 | 1.6 | 0.1 | |
| PandaGPT (7B)A&V=true, TU=false2024.11 | 0.149 | 0.3 | 0.089 | |
| VTimeLLM (7B)A&V=false, TU=true2024.11 | 0.145 | 1.6 | 0.055 | |
| VideoChatGPT (7B)A&V=false, TU=false2024.11 | 0.14 | 0.9 | 0.059 | |
| VideoLLaMA (7B)A&V=true, TU=false2024.11 | 0.115 | 0.1 | 0.089 | |
| NEXT-GPT (7B)A&V=true, TU=false2024.11 | 0.102 | 0 | 0.081 | |
| VideoChat (7B)A&V=false, TU=false2024.11 | 0.096 | 0 | 0.082 |