Video Understanding on Vinoground
20.2Group ScoreBaseline
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| BaselineBackbone=Qwen2.5-VL-7B-Instruct, Token Retention=25%2026.02 | 20.2 | 1 | — | — | |
| FOCUSModel Size=≥7B, Family=Qwen3-VL, Base Model=Qwen3-VL2025.08 | 18.6 | — | 35.6 | 37 | |
| Qwen3-VLModel Size=≥7B, Family=Qwen3-VL2025.08 | 18.2 | — | 34.4 | 35.6 | |
| DivPruneBackbone=Qwen2.5-VL-7B-Instruct, Token Retention=25%2026.02 | 14 | 0.8706 | — | — | |
| IDPrunerBackbone=Qwen2.5-VL-7B-Instruct, Token Retention=25%2026.02 | 13.4 | 0.8713 | — | — | |
| FastVBackbone=Qwen2.5-VL-7B-Instruct, Token Retention=25%2026.02 | 12.8 | 0.8456 | — | — | |
| VisionZipBackbone=Qwen2.5-VL-7B-Instruct, Token Retention=25%2026.02 | 12.8 | 0.8598 | — | — | |
| SCOPEBackbone=Qwen2.5-VL-7B-Instruct, Token Retention=25%2026.02 | 12.8 | 0.864 | — | — | |
| DARTBackbone=Qwen2.5-VL-7B-Instruct, Token Retention=25%2026.02 | 12.6 | 0.8519 | — | — | |
| HiPruneBackbone=Qwen2.5-VL-7B-Instruct, Token Retention=25%2026.02 | 11.8 | 0.8441 | — | — | |
| FOCUSModel Size=<7B, Family=Qwen3-VL, Base Model=Qwen3-VL2025.08 | 11.6 | — | 33 | 25.8 | |
| VisPrunerBackbone=Qwen2.5-VL-7B-Instruct, Token Retention=25%2026.02 | 11.4 | 0.8345 | — | — | |
| VisionSelectorBackbone=Qwen2.5-VL-7B-Instruct, Token Retention=25%2026.02 | 10.8 | 0.8181 | — | — | |
| Qwen3-VLModel Size=<7B, Family=Qwen3-VL2025.08 | 6.2 | — | 32.6 | 17.6 |