Audio-visual understanding on Daily-Omni
82.8AccuracyOmniVideo-R1
Evaluation Results
| Method | Links | |
|---|---|---|
| OmniVideo-R1Model access type=Open-source2026.02 | 82.8 | |
| Qwen3.5-OmniOpen-Source=✗, Size=Flash2026.04 | 81.8 | |
| Gemini-2.5-ProModel access type=Closed-source2026.02 | 81.4 | |
| Gemini-3-ProModel access type=Closed-source2026.02 | 81.1 | |
| video-SALMONN 2+-72BModel access type=Open-source2026.02 | 79.4 | |
| Qwen3-Omni-30B-A3B-ThinkingModel access type=Open-source2026.02 | 75.8 | |
| Nemotron 3 Nano OmniOpen-Source=✓, Size=30B-A3B, Mode=Reasoning off2026.04 | 74.5 | |
| CogniRoute2026.06 | 74.3 | |
| Nemotron 3 Nano OmniOpen-Source=✓, Size=30B-A3B, Mode=Reasoning on2026.04 | 74.1 | |
| Qwen3-OmniOpen-Source=✓, Size=30B-A3B, Mode=Thinking2026.04 | 73.6 | |
| Qwen3 Omni 30BParameters=30B2026.06 | 73.6 | |
| Qwen3-OmniOpen-Source=✓, Size=30B-A3B, Mode=Instruct2026.04 | 71.9 | |
| video-SALMONN 2+-7BModel access type=Open-source2026.02 | 71.8 | |
| DPO w/ SPRecipe=DPO with SFT-policy negatives2026.05 | 69 | |
| DPO w/ OP + SPRecipe=DPO with original-sync and SFT-policy negatives2026.05 | 68.5 | |
| Qwen3-Omni-30BRecipe=Vanilla Baseline2026.05 | 68.2 | |
| DPO w/ SP + FV-DRecipe=DPO with SFT-policy negatives and video preference data2026.05 | 68 | |
| DPO w/ CTP + FV-DRecipe=DPO with counterfactual and video preference data2026.05 | 68 | |
| Final 10K DPO Recipe (Ours)Recipe=Combined CTP, FV-D, and FV-A-L2026.05 | 67.9 | |
| Gemini-2.0-FlashModel access type=Closed-source2026.02 | 67.8 | |
| DPO w/ CTP + FV-D + LV-MCQARecipe=DPO with counterfactual, video preference, and MCQA data2026.05 | 67.8 | |
| DPO w/ OP + FV-D + LV-MCQARecipe=DPO with original-sync, video preference, and MCQA data2026.05 | 67.6 | |
| DPO w/ CTP + FV-D + FV-ARecipe=DPO with counterfactual, video preference, and audio preference data2026.05 | 67.3 | |
| SFT w/ CTP + FV-D + FV-ALRecipe=SFT with counterfactual, general video preference, and audio-visual data2026.05 | 66.9 | |
| v-SALMONN-o1Reasoning=true, Model Size=7B, Zero-shot=true2026.04 | 64 | |
| Qwen3-Omni-30B-A3B-InstructModel access type=Open-source2026.02 | 63.6 | |
| EchoingPixelsModel Size=3B, Token Budget=20%, Est. Tokens Per Min=2,0282025.12 | 60.65 | |
| Qwen2.5-Omni-7BModel Size=7B, Est. Tokens Per Min=10,1402025.12 | 60.48 | |
| Qwen2.5-Omni-3BModel Size=3B, Est. Tokens Per Min=10,1402025.12 | 59.65 | |
| HumanOmniV2-7BModel access type=Open-source2026.02 | 58.5 | |
| EchoingPixelsModel Size=3B, Token Budget=10%, Est. Tokens Per Min=1,0142025.12 | 57.56 | |
| Qwen3-OmniReasoning=true, Model Size=30B, Zero-shot=true2026.04 | 57.5 | |
| EchoingPixelsModel Size=7B, Token Budget=10%, Est. Tokens Per Min=1,0142025.12 | 56.98 | |
| AVRTReasoning=true, Model Size=7B, Zero-shot=true2026.04 | 54.4 | |
| AV-ReasonerReasoning=true, Model Size=7B, Zero-shot=true2026.04 | 53.8 | |
| FastVModel Size=7B, Token Budget=20%, Est. Tokens Per Min=2,0282025.12 | 53.55 | |
| MiniCPM-o-7BModel access type=Open-source2026.02 | 53.1 | |
| EchoingPixelsModel Size=3B, Token Budget=5%, Est. Tokens Per Min=5072025.12 | 52.88 | |
| AF3 (think)Reasoning=true, Model Size=Teacher, Zero-shot=true2026.04 | 52.5 | |
| Ola-7BReasoning=false, Model Size=7B, Zero-shot=true2026.04 | 52.3 | |
| Qwen2.5 OmniReasoning=false, Model Size=7B, Zero-shot=true2026.04 | 51.5 | |
| OlaModel Size=7B, Est. Tokens Per Min=∼16,0002025.12 | 50.71 | |
| Ola-7BModel access type=Open-source2026.02 | 49.9 | |
| FastVModel Size=3B, Token Budget=20%, Est. Tokens Per Min=2,0282025.12 | 49.87 | |
| IntraModalModel Size=7B, Token Budget=25%, Est. Tokens Per Min=2,5352025.12 | 49.79 | |
| AVRTReasoning=true, Model Size=3B, Zero-shot=true2026.04 | 49.2 | |
| V-RTSReasoning=true, Model Size=7B, Zero-shot=true2026.04 | 47.8 | |
| HumanOmniReasoning=true, Model Size=7B, Zero-shot=true2026.04 | 47.6 | |
| Qwen2.5-Omni-7BModel access type=Open-source2026.02 | 47.5 | |
| Kimi-VL-ThinkingReasoning=true, Model Size=Teacher, Zero-shot=true2026.04 | 47 | |
| AVATARReasoning=true, Model Size=7B, Zero-shot=true2026.04 | 47 | |
| Omni-R1Reasoning=true, Model Size=7B, Zero-shot=true2026.04 | 46.8 | |
| IntraModalModel Size=3B, Token Budget=25%, Est. Tokens Per Min=2,5352025.12 | 46.2 | |
| EchoInkReasoning=true, Model Size=7B, Zero-shot=true2026.04 | 46.2 | |
| AVATARReasoning=true, Model Size=3B, Zero-shot=true2026.04 | 44.7 | |
| Qwen2.5 OmniReasoning=false, Model Size=3B, Zero-shot=true2026.04 | 43.1 | |
| VideoLLaMA2-7BModel access type=Open-source2026.02 | 35.2 | |
| VideoLLaMA2Model Size=7B, Est. Tokens Per Min=∼4,1522025.12 | 35.17 | |
| Unified-IO-2-XLModel Size=3B, Est. Tokens Per Min=8962025.12 | 28.32 | |
| Unified-IO-2-XXLModel Size=7B, Est. Tokens Per Min=8962025.12 | 28.24 |