Multimodal Understanding on Aggregate Audio-Visual & Video Benchmarks
57.6Avg Audio-Visual ScoreFull Model (Qwen2.5-Omni-7B)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Full Model (Qwen2.5-Omni-7B)Model Scale=7B, Token Budget=100%2025.12 | 57.6 | 66 | 100 | |
| EchoingPixelsModel Scale=7B, Token Budget=10%2025.12 | 56.2 | 58.4 | 94.1 | |
| Full Model (Qwen2.5-Omni-3B)Model Scale=3B, Token Budget=100%2025.12 | 56.1 | 64.1 | 100 | |
| EchoingPixelsModel Scale=3B, Token Budget=20%2025.12 | 55.5 | 63.5 | 99 | |
| EchoingPixelsModel Scale=3B, Token Budget=10%2025.12 | 53.2 | 61.4 | 95.2 | |
| EchoingPixelsModel Scale=3B, Token Budget=5%2025.12 | 49.8 | 60.4 | 91 | |
| IntraModalModel Scale=7B, Token Budget=25%2025.12 | 49 | 60.1 | 87.6 | |
| IntraModalModel Scale=3B, Token Budget=25%2025.12 | 45.2 | 57.4 | 84.2 |