Video Question Answering on SSV2-QA LLaVA-Hound out-of-domain (test)
37.9AccuracyMM1.5-Video
Evaluation Results
| Method | Links | |
|---|---|---|
| MM1.5-VideoModel Scale=7B, Protocol=SFT2024.09 | 37.9 | |
| LLAVA-HOUND-SFTModel Scale=7B2024.09 | 35.4 | |
| MM1.5-VideoModel Scale=3B, Protocol=SFT2024.09 | 35.2 | |
| MM1.5-VideoModel Scale=1B, Protocol=SFT2024.09 | 34 | |
| MM1.5-VideoModel Scale=7B, Protocol=Training-free2024.09 | 30.4 | |
| MM1.5-VideoModel Scale=3B, Protocol=Training-free2024.09 | 28.2 | |
| MM1.5-VideoModel Scale=1B, Protocol=Training-free2024.09 | 27.2 | |
| Video-LLaVAModel Scale=7B2024.09 | 24.3 | |
| LLaMA-VIDModel Scale=7B2024.09 | 22.2 | |
| Chat-UniViModel Scale=7B2024.09 | 20.6 | |
| Video-ChatGPTModel Scale=7B2024.09 | 19.4 |