Fine-grained audio-visual video understanding on OmniVideoBench
58.9AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-ProModel Accessibility=Proprietary2026.05 | 58.9 | |
| Gemini-2.0-FlashModel Accessibility=Proprietary2026.05 | 41.5 | |
| CogniRoute2026.06 | 38.9 | |
| Qwen3 Omni 30BParameters=30B2026.06 | 38.4 | |
| LatentOmniModel Accessibility=Open-source, Training/Reasoning Strategy=Latent reasoning2026.05 | 35.4 | |
| Qwen2.5-Omni-7B + Explicit Text CoTModel Accessibility=Open-source, Training/Reasoning Strategy=Explicit Text CoT2026.05 | 33.2 | |
| OmniVinciModel Accessibility=Open-source2026.05 | 32.1 | |
| Baichuan-Omni-1.5Model Accessibility=Open-source2026.05 | 30.7 | |
| VITA-1.5-7BModel Accessibility=Open-source2026.05 | 30.5 | |
| HumanOmniV2-7BModel Accessibility=Open-source2026.05 | 30.5 | |
| Qwen2.5-Omni-7B + Vanilla SFTModel Accessibility=Open-source, Training/Reasoning Strategy=Vanilla SFT2026.05 | 30.5 | |
| MiniCPM-o-7BModel Accessibility=Open-source2026.05 | 29.7 | |
| Qwen2.5-Omni-7BModel Accessibility=Open-source, Training/Reasoning Strategy=Base2026.05 | 29.3 | |
| VideoLLaMA2-7BModel Accessibility=Open-source2026.05 | 29.2 |