Video Understanding on Video-MME w/o audio
64.4AccuracyOla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OlaModel Size=7B, Est. Tokens Per Min=∼16,0002025.12 | 64.4 | — | |
| Qwen2.5-Omni-7BModel Size=7B, Est. Tokens Per Min=10,1402025.12 | 63.6 | — | |
| VideoLLaMA2Model Size=7B, Est. Tokens Per Min=∼4,1522025.12 | 62.4 | — | |
| Qwen2.5-Omni-3BModel Size=3B, Est. Tokens Per Min=10,1402025.12 | 60.9 | — | |
| EchoingPixelsModel Size=3B, Token Budget=20%, Est. Tokens Per Min=2,0282025.12 | 58.6 | — | |
| Vita-1.5Model Size=7B, Est. Tokens Per Min=7,0962025.12 | 56.1 | — | |
| EchoingPixelsModel Size=3B, Token Budget=10%, Est. Tokens Per Min=1,0142025.12 | 55.4 | — | |
| IntraModalModel Size=7B, Token Budget=25%, Est. Tokens Per Min=2,5352025.12 | 55.1 | — | |
| EchoingPixelsModel Size=3B, Token Budget=5%, Est. Tokens Per Min=5072025.12 | 54.7 | — | |
| FastVModel Size=7B, Token Budget=20%, Est. Tokens Per Min=2,0282025.12 | 54.6 | — | |
| EchoingPixelsModel Size=7B, Token Budget=10%, Est. Tokens Per Min=1,0142025.12 | 53.8 | — | |
| FastVModel Size=3B, Token Budget=20%, Est. Tokens Per Min=2,0282025.12 | 51.8 | — | |
| IntraModalModel Size=3B, Token Budget=25%, Est. Tokens Per Min=2,5352025.12 | 51.4 | — | |
| EchoingPixelsModel Scale=3B, Token Budget=20%2025.12 | — | 58.6 | |
| EchoingPixelsModel Scale=3B, Token Budget=10%2025.12 | — | 55.4 | |
| EchoingPixelsModel Scale=3B, Token Budget=5%2025.12 | — | 54.7 | |
| EchoingPixelsModel Scale=7B, Token Budget=10%2025.12 | — | 53.8 | |
| Full Model (Qwen2.5-Omni-3B)Model Scale=3B, Token Budget=100%2025.12 | — | 60.9 | |
| Full Model (Qwen2.5-Omni-7B)Model Scale=7B, Token Budget=100%2025.12 | — | 63.6 | |
| IntraModalModel Scale=3B, Token Budget=25%2025.12 | — | 51.4 | |
| IntraModalModel Scale=7B, Token Budget=25%2025.12 | — | 55.1 |