Video Question Answering on ActivityNet-200 Fine-grained 1.0 (test)
3.23CorrectnessST-LLM
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| ST-LLMArchitecture=Encoder-based, Training Data Scope=Different Datasets, Vision Size=1.3B, Modality=V2024.12 | 3.23 | 3.05 | 3.74 | 2.93 | 2.81 | 3.15 | |
| VideoChat2Architecture=Encoder-based, Training Data Scope=Different Datasets, Vision Size=496M, Modality=V+I2024.12 | 3.02 | 2.88 | 3.51 | 2.66 | 2.81 | 2.98 | |
| LLAMA-VIDArchitecture=Encoder-based, Training Data Scope=Different Datasets, Vision Size=1B, Modality=V+I2024.12 | 2.96 | 3 | 3.53 | 2.46 | 2.51 | 2.89 | |
| ChatUniViArchitecture=Encoder-based, Training Data Scope=Different Datasets, Vision Size=307M, Modality=V+I2024.12 | 2.89 | 2.91 | 3.46 | 2.39 | 2.81 | 2.89 | |
| Video-LLaVAArchitecture=Encoder-based, Training Data Scope=Different Datasets, Vision Size=425M, Modality=V+I2024.12 | 2.84 | 2.86 | 3.44 | 2.46 | 2.57 | 2.81 | |
| Video-PandaArchitecture=Encoder-free, Training Data Scope=Same Dataset, Vision Size=45M, Modality=V2024.12 | 2.74 | 2.47 | 3.01 | 2.26 | 2.36 | 2.57 | |
| Video-LLaVA*Architecture=Encoder-based, Training Data Scope=Same Dataset, Vision Size=425M, Modality=V, Note=trained with video-only datasets for fair comparison2024.12 | 2.46 | 2.37 | 2.89 | 2.12 | 2.17 | 2.4 | |
| Video-ChatGPTArchitecture=Encoder-based, Training Data Scope=Same Dataset, Vision Size=307M, Modality=V2024.12 | 2.4 | 2.52 | 2.62 | 1.98 | 2.37 | 2.38 | |
| VideoChatArchitecture=Encoder-based, Training Data Scope=Different Datasets, Vision Size=1.2B, Modality=V2024.12 | 2.23 | 2.5 | 2.53 | 1.94 | 2.24 | 2.29 | |
| LLAMA AdapterArchitecture=Encoder-based, Training Data Scope=Different Datasets, Vision Size=404.3M, Modality=I2024.12 | 2.03 | 2.32 | 2.3 | 1.98 | 2.15 | 2.16 | |
| Video-LLaMAArchitecture=Encoder-based, Training Data Scope=Different Datasets, Vision Size=1.1B, Modality=V2024.12 | 1.96 | 2.18 | 2.16 | 1.82 | 1.79 | 1.98 |