Video Question Answering on NextQA (WUPS)
33.86WUPSHYBRIDKV
Evaluation Results
| Method | Links | |
|---|---|---|
| HYBRIDKVModel Architecture=Qwen2.5-VL-7B2026.04 | 33.86 | |
| SPARSEMMModel Architecture=Qwen2.5-VL-7B2026.04 | 33.84 | |
| FULL CACHEModel Architecture=Qwen2.5-VL-7B2026.04 | 33.79 | |
| SNAPKVModel Architecture=Qwen2.5-VL-7B2026.04 | 33.29 | |
| MADAKVModel Architecture=Qwen2.5-VL-7B2026.04 | 33.25 | |
| LOOK-MModel Architecture=Qwen2.5-VL-7B2026.04 | 33.07 | |
| SPARSEMMModel Architecture=Qwen2.5-VL-3B2026.04 | 31.07 | |
| HYBRIDKVModel Architecture=Qwen2.5-VL-3B2026.04 | 30.7 | |
| LOOK-MModel Architecture=Qwen2.5-VL-3B2026.04 | 30.49 | |
| SNAPKVModel Architecture=Qwen2.5-VL-3B2026.04 | 30.1 | |
| MADAKVModel Architecture=Qwen2.5-VL-3B2026.04 | 30 | |
| FULL CACHEModel Architecture=Qwen2.5-VL-3B2026.04 | 29.81 | |
| ReDiPruneBackbone=LLaVA-NeXT-Video-7B, Keep ratio=0.15, TFLOPs (ratio %)=4.429 (14.77)2026.03 | 26.42 | |
| Original*Backbone=LLaVA-NeXT-Video-7B, Keep ratio=0.15, TFLOPs (ratio %)=29.918 (100)2026.03 | 26.33 | |
| DivPrune*Backbone=LLaVA-NeXT-Video-7B, Keep ratio=0.15, TFLOPs (ratio %)=4.429 (14.77)2026.03 | 23.7 | |
| CDPruner*Backbone=LLaVA-NeXT-Video-7B, Keep ratio=0.15, TFLOPs (ratio %)=4.429 (14.77)2026.03 | 23.53 | |
| FULL CACHEModel Architecture=LLaVA-OV-7B2026.04 | 20.18 | |
| HYBRIDKVModel Architecture=LLaVA-OV-7B2026.04 | 19.62 | |
| SPARSEMMModel Architecture=LLaVA-OV-7B2026.04 | 18.86 | |
| MADAKVModel Architecture=LLaVA-OV-7B2026.04 | 18.79 | |
| LOOK-MModel Architecture=LLaVA-OV-7B2026.04 | 18.69 | |
| SNAPKVModel Architecture=LLaVA-OV-7B2026.04 | 18.56 | |
| ReDiPruneBackbone=LLaVA 1.5-7B, Keep ratio=0.15, TFLOPs (ratio %)=2.188 (17.86)2026.03 | 15.92 | |
| DivPrune*Backbone=LLaVA 1.5-7B, Keep ratio=0.15, TFLOPs (ratio %)=2.188 (17.86)2026.03 | 15.6 | |
| CDPruner*Backbone=LLaVA 1.5-7B, Keep ratio=0.15, TFLOPs (ratio %)=2.188 (17.86)2026.03 | 15.4 | |
| Original*Backbone=LLaVA 1.5-7B, Keep ratio=0.15, TFLOPs (ratio %)=12.177 (100)2026.03 | 15.22 |