Audio-visual understanding on IntentBench
74.2AccuracyOmniVideo-R1
Evaluation Results
| Method | Links | |
|---|---|---|
| OmniVideo-R1Model access type=Open-source2026.02 | 74.2 | |
| Gemini-3-ProModel access type=Closed-source2026.02 | 71.5 | |
| HumanOmniV2-7BModel access type=Open-source2026.02 | 69.3 | |
| Qwen3-Omni-30B-A3B-ThinkingModel access type=Open-source2026.02 | 68.5 | |
| Gemini-2.0-FlashModel access type=Closed-source2026.02 | 67.8 | |
| Gemini-2.5-ProModel access type=Closed-source2026.02 | 67.2 | |
| Qwen3-Omni-30B-A3B-InstructModel access type=Open-source2026.02 | 65.7 | |
| Qwen2.5-Omni-7BModel access type=Open-source2026.02 | 64.2 | |
| Qwen2.5-Omni + AVATARReinforcement Learning Strategy=AVATAR2025.08 | 63.9 | |
| Qwen2.5-Omni + GRPOReinforcement Learning Strategy=GRPO2025.08 | 63.8 | |
| Qwen2.5-OmniReinforcement Learning Strategy=Baseline2025.08 | 63.7 | |
| EcholnkReinforcement Learning Strategy=N/A2025.08 | 63.6 | |
| Omni-R1Reinforcement Learning Strategy=N/A2025.08 | 63.5 | |
| Ola-7B + AVATARReinforcement Learning Strategy=AVATAR2025.08 | 61.9 | |
| Ola-7B + GRPOReinforcement Learning Strategy=GRPO2025.08 | 60.3 | |
| AV-ReasonerReinforcement Learning Strategy=N/A2025.08 | 59.5 | |
| Ola-7BReinforcement Learning Strategy=Baseline2025.08 | 59.1 | |
| Ola-7BModel access type=Open-source2026.02 | 57.4 | |
| MiniCPM-o-7BModel access type=Open-source2026.02 | 54.5 | |
| VITA-1.5-7BModel access type=Open-source2026.02 | 54.2 |