Audio-Visual Understanding on Video-MME w/ audio
68.4AccuracyOla
Evaluation Results
| Method | Links | |
|---|---|---|
| OlaModel Size=7B, Est. Tokens Per Min=∼16,0002025.12 | 68.4 | |
| Qwen2.5-Omni-7BModel Size=7B, Est. Tokens Per Min=10,1402025.12 | 66.3 | |
| EchoingPixelsModel Size=7B, Token Budget=10%, Est. Tokens Per Min=1,0142025.12 | 64.1 | |
| Qwen2.5-Omni-3BModel Size=3B, Est. Tokens Per Min=10,1402025.12 | 63.1 | |
| EchoingPixelsModel Size=3B, Token Budget=20%, Est. Tokens Per Min=2,0282025.12 | 60.7 | |
| EchoingPixelsModel Size=3B, Token Budget=10%, Est. Tokens Per Min=1,0142025.12 | 58.4 | |
| IntraModalModel Size=7B, Token Budget=25%, Est. Tokens Per Min=2,5352025.12 | 56.5 | |
| EchoingPixelsModel Size=3B, Token Budget=5%, Est. Tokens Per Min=5072025.12 | 55.7 | |
| IntraModalModel Size=3B, Token Budget=25%, Est. Tokens Per Min=2,5352025.12 | 52.1 | |
| FastVModel Size=3B, Token Budget=20%, Est. Tokens Per Min=2,0282025.12 | 51.9 |