Video-based Text Generation on VCGBench 1.0 (test)
3.81CILLaVA-NeXT-Video-DPO
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| LLaVA-NeXT-Video-DPOLLM Size=34B, Vision Encoder=CLIP-L, Training Protocol=SFT2024.07 | 3.81 | 3.55 | 4.24 | 3.14 | 4.12 | 3.77 | |
| LLaVA-NeXT-VideoLLM Size=34B, Vision Encoder=CLIP-L, Training Protocol=SFT2024.07 | 3.48 | 3.37 | 3.95 | 2.64 | 3.28 | 3.34 | |
| SF-LLaVA-34BLLM Size=34B, Vision Encoder=CLIP-L, Training Protocol=Training-free2024.07 | 3.48 | 2.96 | 3.84 | 2.77 | 3.57 | 3.32 | |
| LLaVA-NeXT-ImageLLM Size=34B, Vision Encoder=CLIP-L, Training Protocol=Training-free2024.07 | 3.29 | 3.23 | 3.83 | 2.51 | 3.47 | 3.27 | |
| IG-VLM (LLaVA-v1.6)LLM Size=34B, Vision Encoder=CLIP-L, Training Protocol=Training-free2024.07 | 3.11 | 2.78 | 3.51 | 2.44 | 3.29 | 3.03 | |
| Video-LLaMA2LLM Size=46.7B, Vision Encoder=CLIP-L, Training Protocol=SFT2024.07 | 3.08 | 3.11 | 3.64 | 2.67 | 3.26 | 3.15 |