Spatial Perception Video Understanding on VsiBench
39.8Overall ScoreAdaSpark
Evaluation Results
| Method | Links | |
|---|---|---|
| AdaSparkModel Size=Mid Size, Backbone=Qwen-2.5-VL-7B, SFT=true2026.04 | 39.8 | |
| FrameFusionModel Size=Mid Size, Backbone=Qwen-2.5-VL-7B, SFT=true2026.04 | 39.3 | |
| FastVModel Size=Mid Size, Backbone=Qwen-2.5-VL-7B, SFT=true2026.04 | 39.2 | |
| ToMeModel Size=Mid Size, Backbone=Qwen-2.5-VL-7B, SFT=true2026.04 | 38.7 | |
| Qwen-2.5-VL-7B + SFTModel Size=Mid Size, SFT=true2026.04 | 36.7 | |
| AdaSparkModel Size=Small Size, Backbone=Qwen-2.5-VL-3B, SFT=true2026.04 | 35.8 | |
| Qwen-2.5-VL-7BModel Size=Mid Size, SFT=false2026.04 | 35.6 | |
| MoBAModel Size=Mid Size, Backbone=Qwen-2.5-VL-7B, SFT=true2026.04 | 34.8 | |
| FrameFusionModel Size=Small Size, Backbone=Qwen-2.5-VL-3B, SFT=true2026.04 | 33.6 | |
| Qwen-2.5-VL-3B + SFTModel Size=Small Size, SFT=true2026.04 | 33.1 | |
| Qwen-2.5-VL-3BModel Size=Small Size, SFT=false2026.04 | 32.4 | |
| FastVModel Size=Small Size, Backbone=Qwen-2.5-VL-3B, SFT=true2026.04 | 29.9 | |
| ToMeModel Size=Small Size, Backbone=Qwen-2.5-VL-3B, SFT=true2026.04 | 29.4 | |
| MoBAModel Size=Small Size, Backbone=Qwen-2.5-VL-3B, SFT=true2026.04 | 28.9 |