Multi-discipline Video Understanding on SeedBench video
62.1AccuracyLLaVA-OneVision-72B
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-OneVision-72BModel Scale=72B2024.08 | 62.1 | |
| LLaVA-OV-72BBackbone=72B2024.12 | 62.1 | |
| LLaVA-OV-72Bvariant=Single-Image (SI), Backbone=72B2024.12 | 60.9 | |
| GPT-4VVersion=V-Preview2024.08 | 60.5 | |
| MAmmoTH-VL-8BBackbone=8B2024.12 | 57.1 | |
| LLaVA-OneVision-7BModel Scale=7B2024.08 | 56.9 | |
| LLaVA-OV-7BBackbone=7B2024.12 | 56.9 | |
| Qwen2-VL-7B-Ins.Backbone=7B-Instruct2024.12 | 55.3 | |
| InternVL-2-8BBackbone=8B2024.12 | 54.9 | |
| LLaVA-OV-7Bvariant=Single-Image (SI), Backbone=7B2024.12 | 51.1 | |
| LLaVA-OneVision-0.5BModel Scale=0.5B2024.08 | 44.2 |