Open-ended Video Question Answering on VideoChatGPT Bench (test)
3.45Correctness of Information (CI)LLaVA-OneVision
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| LLaVA-OneVision# Frames=32, # Tokens=62722025.03 | 3.45 | 3 | 3.71 | 2.68 | 3.14 | 3.2 | |
| LLaVA-Next-Video# Frames=32, # Tokens=46082025.03 | 3.39 | 3.29 | 3.92 | 2.6 | 3.12 | 3.26 | |
| HIComModel Scale=7B, # Frames=128, # Tokens=26242025.03 | 3.33 | 2.86 | 3.65 | 2.74 | 3.32 | 3.18 | |
| HIComModel Scale=7B, # Frames=64, # Tokens=13282025.03 | 3.32 | 2.92 | 3.65 | 2.74 | 3.35 | 3.2 | |
| HIComModel Scale=7B, # Frames=32, # Tokens=6802025.03 | 3.29 | 2.85 | 3.59 | 2.67 | 3.22 | 3.12 | |
| ST-LLM# Frames=16, # Tokens=5122025.03 | 3.23 | 3.05 | 3.74 | 2.93 | 2.81 | 3.15 | |
| PLLAVA# Frames=16, # Tokens=23042025.03 | 3.21 | 2.86 | 3.62 | 2.33 | 2.93 | 2.99 | |
| VideoLLaMA2# Frames=16, # Tokens=11522025.03 | 3.16 | 3.08 | 3.69 | 2.56 | 3.14 | 3.13 | |
| SF-LLAVA# Frames=50, # Tokens=36802025.03 | 3.09 | 2.7 | 3.57 | 2.52 | 3.35 | 3.04 | |
| HIComModel Scale=1.5B, # Frames=32, # Tokens=6802025.03 | 3.09 | 2.67 | 3.4 | 2.41 | 2.98 | 2.91 | |
| LongVA# Frames=128, # Tokens=184322025.03 | 3.05 | 3.09 | 3.77 | 2.44 | 3.64 | 3.2 | |
| VideoChat2# Frames=16, # Tokens=15362025.03 | 3.02 | 2.88 | 3.51 | 2.66 | 2.81 | 2.98 | |
| LLaMA-VID# Frames=1fps, # Tokens=2tps2025.03 | 2.96 | 3 | 3.53 | 2.46 | 2.51 | 2.89 | |
| Chat-Univi# Frames=64, # Tokens=4482025.03 | 2.89 | 2.91 | 3.46 | 2.89 | 2.81 | 2.99 | |
| LongVLM# Frames=100, # Tokens=3052025.03 | 2.76 | 2.86 | 3.34 | 2.39 | 3.11 | 2.89 |