Video Question Answering on TGIF
79.1Top-1 AccVAST
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| VAST2023.05 | 79.1 | — | — | — | — | — | — | — | |
| VLAB-G#Data(M)=262023.05 | 79 | — | — | — | — | — | — | — | |
| MiCo2024.06 | 78.9 | — | — | — | — | — | — | — | |
| Method [7]2023.05 | 78.7 | — | — | — | — | — | — | — | |
| SOTA2024.06 | 78.7 | — | — | — | — | — | — | — | |
| VLAB-L#Data(M)=262023.05 | 78.2 | — | — | — | — | — | — | — | |
| mPLUG-2#Data(M)=172023.05 | 75.4 | — | — | — | — | — | — | — | |
| GiT2#Data(M)=129002023.05 | 74.9 | — | — | — | — | — | — | — | |
| LAVENDER#Data(M)=302023.05 | 73.5 | — | — | — | — | — | — | — | |
| HiTeA#Data(M)=172023.05 | 73.2 | — | — | — | — | — | — | — | |
| GiT#Data(M)=8002023.05 | 72.8 | — | — | — | — | — | — | — | |
| InternVideo2022.12 | 72.2 | — | — | — | — | — | — | — | |
| InternVideo#Data(M)=2102023.05 | 72.2 | — | — | — | — | — | — | — | |
| Clover#Data(M)=52023.05 | 71.6 | — | — | — | — | — | — | — | |
| MERLOT2022.12 | 69.5 | — | — | — | — | — | — | — | |
| VIOLET2022.12 | 68.9 | — | — | — | — | — | — | — | |
| FrozenBiLM#Data(M)=302023.05 | 68.6 | — | — | — | — | — | — | — | |
| All-in-one#Data(M)=2832023.05 | 66.3 | — | — | — | — | — | — | — | |
| All-in-one2022.12 | 64.2 | — | — | — | — | — | — | — | |
| ClipBERT2022.12 | 60.3 | — | — | — | — | — | — | — | |
| DUET-VLM (C)Tokens=960, Token Reduction (%)=53.12%2026.02 | 48.9 | — | — | — | — | 100.8 | — | — | |
| VisionTrimBase Model=Video-LLaVA-7B, Number of tokens=1362026.01 | 47.4 | — | — | — | — | — | — | — | |
| VanillaBase Model=Video-LLaVA-7B, Number of tokens=1362026.01 | 47.1 | — | — | — | — | — | — | — | |
| Video-LLaVATokens=2048, Token Reduction (%)=0%2026.02 | 47.1 | — | — | — | — | 100 | — | — | |
| VanillaBase Model=Video-LLaVA-7B, Token Reduction Rate=0.0%2025.05 | 47.1 | — | — | — | — | — | — | — | |
| Video-LLaVA2026.03 | 47.1 | — | — | — | — | 100 | — | — | |
| PyramidDropTokens=960, Token Reduction (%)=53.12%2026.02 | 46.9 | — | — | — | — | 100.7 | — | — | |
| DUET-VLM (C)Tokens=136, Token Reduction (%)=93.4%2026.02 | 46.3 | — | — | — | — | 97.6 | — | — | |
| PRUNESID2026.03 | 45.8 | — | — | — | — | 95.5 | — | — | |
| VanillaVisual Tokens=20482026.06 | 45.7 | — | — | — | — | — | — | — | |
| CLASPBackbone=Video-LLaVA-7B2026.04 | 45.65 | — | — | — | — | — | — | 52.95 | |
| MoB (with η-prior)Base Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 45.3 | — | — | — | — | — | — | — | |
| Uniform SamplingBase Model=Video-LLaVA-7B, Number of tokens=1362026.01 | 45.2 | — | — | — | — | — | — | — | |
| SparseVLMTokens=136, Token Reduction (%)=93.4%2026.02 | 44.7 | — | — | — | — | 82.4 | — | — | |
| SparseVLMBase Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 44.7 | — | — | — | — | — | — | — | |
| TwigVLMBase Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 44.7 | — | — | — | — | — | — | — | |
| SparseVLM2026.03 | 44.7 | — | — | — | — | 86.5 | — | — | |
| SparseVLMBackbone=Video-LLaVA-7B2026.04 | 44.67 | — | — | — | — | — | — | 51.22 | |
| Upper BoundBackbone=Video-LLaVA-7B2026.04 | 43.47 | — | — | — | — | — | — | 52.23 | |
| VisionZipTokens=136, Token Reduction (%)=93.4%2026.02 | 42.4 | — | — | — | — | 91 | — | — | |
| VisionZipBase Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 42.4 | — | — | — | — | — | — | — | |
| VisionZip2026.03 | 42.4 | — | — | — | — | 93.2 | — | — | |
| DCP-PruneVisual Tokens=1282026.06 | 33.6 | — | — | — | — | — | — | — | |
| DCP-PruneVisual Tokens=642026.06 | 30.57 | — | — | — | — | — | — | — | |
| FlowCutVisual Tokens=1282026.06 | 29.39 | — | — | — | — | — | — | — | |
| BaselineModel=Video-LLaVA-7B, FLOPS Ratio=02025.03 | 27 | — | — | — | 41,413 | — | — | — | |
| FlowCutVisual Tokens=642026.06 | 25.8 | — | — | — | — | — | — | — | |
| SCOPEVisual Tokens=1282026.06 | 25.75 | — | — | — | — | — | — | — | |
| TopVModel=Video-LLaVA-7B, FLOPS Ratio=51%2025.03 | 25 | — | — | — | 37,023 | — | — | — | |
| FastVModel=Video-LLaVA-7B, FLOPS Ratio=47%2025.03 | 24 | — | — | — | 67,030 | — | — | — | |
| FastVBackbone Model=Video-LLaVA-7B, Token Retention=2562025.06 | 23.2 | — | — | — | — | — | 2.48 | — | |
| FastVTokens=136, Token Reduction (%)=93.4%2026.02 | 23.1 | — | — | — | — | 45.8 | — | — | |
| FastVBase Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 23.1 | — | — | — | — | — | — | — | |
| FastV2026.03 | 23.1 | — | — | — | — | 52.1 | — | — | |
| SCOPEVisual Tokens=642026.06 | 20.47 | — | — | — | — | — | — | — | |
| Video-LLaVABackbone Model=Video-LLaVA-7B, Token Retention=2562025.06 | 18.9 | — | — | — | — | — | 2.52 | — | |
| Video-LLaVAtokens_kept=all2026.04 | 18.9 | — | — | — | — | — | 2.54 | — | |
| VisionDropBackbone Model=Video-LLaVA-7B, Token Retention=2562025.06 | 18.8 | — | — | — | — | — | 2.48 | — | |
| VisPrunertokens_kept=2272026.04 | 15.9 | — | — | — | — | — | 2.41 | — | |
| MI-Prunertokens_kept=2272026.04 | 15.7 | — | — | — | — | — | 2.44 | — | |
| VisionZipBackbone Model=Video-LLaVA-7B, Token Retention=2562025.06 | 15.6 | — | — | — | — | — | 2.4 | — | |
| FastVtokens_kept=2272026.04 | 14.3 | — | — | — | — | — | 2.42 | — | |
| Video-LLaVAStrategy=Vanilla, Evaluator=Gem2026.06 | 14.2 | — | — | — | — | — | 0.77 | — | |
| PriorTR + MergingStrategy=Merging, Evaluator=Gem2026.06 | 14.2 | — | — | — | — | — | 0.74 | — | |
| VisPrunertokens_kept=1142026.04 | 14.1 | — | — | — | — | — | 2.35 | — | |
| MI-Prunertokens_kept=1142026.04 | 13.1 | — | — | — | — | — | 2.4 | — | |
| SparseVLMStrategy=Merging, Evaluator=Gem2026.06 | 13.1 | — | — | — | — | — | 0.71 | — | |
| Video-LLaVAStrategy=Vanilla, Evaluator=GPT2026.06 | 11.3 | — | — | — | — | — | 1.19 | — | |
| PriorTR + MergingStrategy=Merging, Evaluator=GPT2026.06 | 10.9 | — | — | — | — | — | 1.05 | — | |
| SparseVLMStrategy=Merging, Evaluator=GPT2026.06 | 10.7 | — | — | — | — | — | 1.03 | — | |
| FastVtokens_kept=1142026.04 | 10.6 | — | — | — | — | — | 2.29 | — | |
| PriorTRStrategy=Pruning, Evaluator=Gem2026.06 | 4.8 | — | — | — | — | — | 0.27 | — | |
| PriorTRStrategy=Pruning, Evaluator=GPT2026.06 | 4.1 | — | — | — | — | — | 1.2 | — | |
| FastVStrategy=Pruning, Evaluator=GPT2026.06 | 2.8 | — | — | — | — | — | 1.16 | — | |
| FastVStrategy=Pruning, Evaluator=Gem2026.06 | 2.3 | — | — | — | — | — | 0.14 | — | |
| All-in-1Pre-training dataset=W2M+H100M2022.07 | — | 92.7 | 94.3 | 64.2 | — | — | — | — | |
| clipBertPre-training dataset=COCO, VG2022.07 | — | 82.8 | 87.8 | 60.3 | — | — | — | — | |
| CloverPre-training dataset=W2M+C3M2022.07 | — | 95 | 98.2 | 71.6 | — | — | — | — | |
| MERLOTPre-training dataset=Y180M2022.07 | — | 94 | 96.2 | 69.5 | — | — | — | — | |
| VIOLETPre-training dataset=W2M+C3M+Y180M2022.07 | — | 92.5 | 95.7 | 68.9 | — | — | — | — |