Audio-Visual Understanding on Video-MME
73.4Scorevideo-SALMONN 2+
Evaluation Results
| Method | Links | |
|---|---|---|
| video-SALMONN 2+Model Parameters=7B2026.02 | 73.4 | |
| D-ORCAModel Parameters=8B2026.02 | 72.9 | |
| Qwen3-Omni-InstructModel Parameters=30B-A3B2026.02 | 70.5 | |
| OmniVinciModel Parameters=7B2026.02 | 68.6 | |
| Full Model (Qwen2.5-Omni-7B)Model Scale=7B, Token Budget=100%2025.12 | 66.3 | |
| AVoCaDOModel Parameters=7B2026.02 | 65.9 | |
| Qwen2.5-OmniModel Parameters=7B2026.02 | 64.3 | |
| EchoingPixelsModel Scale=7B, Token Budget=10%2025.12 | 64.1 | |
| Full Model (Qwen2.5-Omni-3B)Model Scale=3B, Token Budget=100%2025.12 | 63.1 | |
| ARC-Qwen-Video-NarratorModel Parameters=7B2026.02 | 62.4 | |
| EchoingPixelsModel Scale=3B, Token Budget=20%2025.12 | 60.7 | |
| EchoingPixelsModel Scale=3B, Token Budget=10%2025.12 | 58.4 | |
| IntraModalModel Scale=7B, Token Budget=25%2025.12 | 56.5 | |
| EchoingPixelsModel Scale=3B, Token Budget=5%2025.12 | 55.7 | |
| IntraModalModel Scale=3B, Token Budget=25%2025.12 | 52.1 |