Video Text Generation on VCGBench
3.64Correct Information (CI)LLaVA-NeXT-Video-DPO
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| LLaVA-NeXT-Video-DPOLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=SFT2024.07 | 3.64 | 3.45 | 4.17 | 2.95 | 4.08 | 3.66 | |
| LLaVA-NeXT-VideoLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=SFT2024.07 | 3.39 | 3.29 | 3.92 | 2.6 | 3.12 | 3.26 | |
| VideoGPT+LLM Size=3.8B, Vision Encoder=CLIP-L, Training Strategy=SFT2024.07 | 3.27 | 3.18 | 3.74 | 2.83 | 3.39 | 3.28 | |
| Video-LLaMA2LLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=SFT2024.07 | 3.16 | 3.08 | 3.69 | 2.56 | 3.14 | 3.13 | |
| IG-VLM (LLaVA-v1.6)LLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.07 | 3.11 | 2.78 | 3.51 | 2.44 | 3.29 | 3.03 | |
| SF-LLaVA-7BLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.07 | 3.09 | 2.7 | 3.57 | 2.52 | 3.35 | 3.04 | |
| LLaVA-NeXT-ImageLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=Training-free2024.07 | 3.05 | 3.12 | 3.68 | 2.37 | 3.16 | 3.07 | |
| VideoChat2LLM Size=7B, Vision Encoder=UMT-L, Training Strategy=SFT2024.07 | 3.02 | 2.88 | 3.51 | 2.66 | 2.81 | 2.98 | |
| LLAMA-VIDLLM Size=13B, Vision Encoder=CLIP-G, Training Strategy=SFT2024.07 | 2.96 | 3 | 3.53 | 2.46 | 2.51 | 2.89 | |
| MovieChatLLM Size=7B, Vision Encoder=CLIP-G, Training Strategy=SFT2024.07 | 2.76 | 2.93 | 3.01 | 2.24 | 2.42 | 2.67 | |
| Video-ChatGPTLLM Size=7B, Vision Encoder=CLIP-L, Training Strategy=SFT2024.07 | 2.5 | 2.57 | 2.69 | 2.16 | 2.2 | 2.42 | |
| Vista-LLaMALLM Size=7B, Vision Encoder=CLIP-G, Training Strategy=SFT2024.07 | 2.44 | 2.64 | 3.18 | 2.26 | 2.31 | 2.57 | |
| VideoChatLLM Size=7B, Vision Encoder=CLIP-G, Training Strategy=SFT2024.07 | 2.23 | 2.5 | 2.53 | 1.94 | 2.24 | 2.29 | |
| Video-LLaMALLM Size=7B, Vision Encoder=CLIP-G, Training Strategy=SFT2024.07 | 1.96 | 2.18 | 2.16 | 1.82 | 1.79 | 1.98 |