Video Question Answering on LongVideoBench (test)
63.7Accuracy (Long)FOCUS (LLaVA-V-7B)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| FOCUS (LLaVA-V-7B)Frame=642026.04 | 63.7 | — | 59 | 72.3 | |
| GPT-4o (0513)Frame=2562026.04 | 61.6 | — | 66.7 | 76.8 | |
| Qwen3-VL + Q-GateBackbone=Qwen3-VL, Strategy=Q-Gate, Frame=322026.04 | 59.4 | — | 63.11 | 70.59 | |
| LLaVA-OneVision-72BFrame=322026.04 | 59.3 | — | 63.9 | 77.4 | |
| LLaVA-Video-72B-Qwen2Frame=1282026.04 | 59.3 | — | 63.9 | 77.4 | |
| Qwen3-VL + Q-GateBackbone=Qwen3-VL, Strategy=Q-Gate, Frame=82026.04 | 58.69 | — | 63.11 | 68.24 | |
| Qwen3-VL + AKS*Backbone=Qwen3-VL, Strategy=AKS*, Frame=322026.04 | 57.8 | — | 65.29 | 67.06 | |
| Qwen3-VL + AKS*Backbone=Qwen3-VL, Strategy=AKS*, Frame=82026.04 | 54.61 | — | 60.92 | 70.59 | |
| Qwen3-VL + VSLSBackbone=Qwen3-VL, Strategy=VSLS, Frame=322026.04 | 52.66 | — | 58.74 | 65.88 | |
| Qwen3-VL + T*Backbone=Qwen3-VL, Strategy=T*, Frame=322026.04 | 51.95 | — | 56.55 | 69.41 | |
| Qwen3-VL + VSLSBackbone=Qwen3-VL, Strategy=VSLS, Frame=82026.04 | 51.6 | — | 55.83 | 69.41 | |
| Qwen3-VL (Uniform)Backbone=Qwen3-VL, Strategy=Uniform, Frame=322026.04 | 51.24 | — | 56.55 | 71.76 | |
| Qwen3-VL + T*Backbone=Qwen3-VL, Strategy=T*, Frame=82026.04 | 50.89 | — | 54.13 | 67.06 | |
| GPT-4o + Q-GateBackbone=GPT-4o, Strategy=Q-Gate, Frame=82026.04 | 50.71 | — | 56.55 | 65.41 | |
| Uniform SamplingBackbone Model=GPT-4o, Initial Keyframe Setting=Top 32, Avg. Frames=32.02025.08 | 50.6 | — | 53.5 | 74 | |
| GPT-4o + Q-GateBackbone=GPT-4o, Strategy=Q-Gate, Frame=322026.04 | 50.35 | — | 53.64 | 63.75 | |
| GPT-4o + AKS*Backbone=GPT-4o, Strategy=AKS*, Frame=82026.04 | 49.65 | — | 53.88 | 59.49 | |
| AFP+GraphBackbone Model=GPT-4o, Initial Keyframe Setting=Top 32, Avg. Frames=4.12025.08 | 49.1 | — | 53.5 | 84 | |
| GPT-4o + AKS*Backbone=GPT-4o, Strategy=AKS*, Frame=322026.04 | 47.7 | — | 50.97 | 61.88 | |
| AFP+GraphBackbone Model=GPT-4o, Initial Keyframe Setting=Top 8, Avg. Frames=2.12025.08 | 47.3 | — | 53.1 | 78 | |
| Uniform SamplingBackbone Model=GPT-4o, Initial Keyframe Setting=Top 8, Avg. Frames=8.02025.08 | 47.1 | — | 49.4 | 67.3 | |
| AKS*Backbone Model=GPT-4o, Initial Keyframe Setting=Top 8, Avg. Frames=8.02025.08 | 47 | — | 46.2 | 66 | |
| AKS*Backbone Model=GPT-4o, Initial Keyframe Setting=Top 32, Avg. Frames=32.02025.08 | 47 | — | 49.2 | 58 | |
| Qwen3-VL (Uniform)Backbone=Qwen3-VL, Strategy=Uniform, Frame=82026.04 | 46.63 | — | 51.46 | 71.76 | |
| GPT-4o + VSLSBackbone=GPT-4o, Strategy=VSLS, Frame=82026.04 | 45.21 | — | 49.76 | 56.25 | |
| AFP+GraphBackbone Model=LLaVA-Video-7B, Initial Keyframe Setting=Top 32, Avg. Frames=4.12025.08 | 45.2 | — | 53.8 | 64 | |
| AFP+GraphBackbone Model=LLaVA-Video-7B, Initial Keyframe Setting=Top 8, Avg. Frames=2.12025.08 | 44.6 | — | 53.1 | 62 | |
| GPT-4o + VSLSBackbone=GPT-4o, Strategy=VSLS, Frame=322026.04 | 44.5 | — | 49.51 | 68.24 | |
| GPT-4o (Uniform)Backbone=GPT-4o, Strategy=Uniform, Frame=322026.04 | 43.79 | — | 46.36 | 60 | |
| GPT-4o + T*Backbone=GPT-4o, Strategy=T*, Frame=322026.04 | 43.62 | — | 48.79 | 63.53 | |
| AFP+GraphBackbone Model=Qwen2.5-VL-7B, Initial Keyframe Setting=Top 32, Avg. Frames=4.12025.08 | 43.5 | — | 46.9 | 64 | |
| AKS*Backbone Model=LLaVA-Video-7B, Initial Keyframe Setting=Top 32, Avg. Frames=32.02025.08 | 43.5 | — | 46.5 | 50 | |
| AFP+GraphBackbone Model=Qwen2.5-VL-7B, Initial Keyframe Setting=Top 8, Avg. Frames=2.12025.08 | 42.9 | — | 46.5 | 64 | |
| GPT-4o + T*Backbone=GPT-4o, Strategy=T*, Frame=82026.04 | 42.73 | — | 47.82 | 64.71 | |
| Uniform SamplingBackbone Model=LLaVA-Video-7B, Initial Keyframe Setting=Top 32, Avg. Frames=32.02025.08 | 41.7 | — | 46.2 | 40 | |
| AKS*Backbone Model=LLaVA-Video-7B, Initial Keyframe Setting=Top 8, Avg. Frames=8.02025.08 | 41.4 | — | 45.8 | 52 | |
| GPT-4o (Uniform)Backbone=GPT-4o, Strategy=Uniform, Frame=82026.04 | 40.43 | — | 43.69 | 57.65 | |
| Uniform SamplingBackbone Model=Qwen2.5-VL-7B, Initial Keyframe Setting=Top 8, Avg. Frames=8.02025.08 | 40.3 | — | 38.4 | 42.8 | |
| Uniform SamplingBackbone Model=LLaVA-Video-7B, Initial Keyframe Setting=Top 8, Avg. Frames=8.02025.08 | 40.2 | — | 46.9 | 50 | |
| AKS*Backbone Model=Qwen2.5-VL-7B, Initial Keyframe Setting=Top 32, Avg. Frames=32.02025.08 | 35.7 | — | 42.7 | 60 | |
| AKS*Backbone Model=Qwen2.5-VL-7B, Initial Keyframe Setting=Top 8, Avg. Frames=8.02025.08 | 35.4 | — | 41.5 | 56 | |
| Uniform SamplingBackbone Model=Qwen2.5-VL-7B, Initial Keyframe Setting=Top 32, Avg. Frames=32.02025.08 | 32.7 | — | 36.5 | 50 | |
| FastVSize=7B, Tokens (%)=25.02026.03 | — | 56.8 | — | — | |
| FastVSize=7B, Tokens (%)=15.02026.03 | — | 51.5 | — | — | |
| FastVIDSize=7B, Tokens (%)=25.02026.03 | — | 56.3 | — | — | |
| FastVIDSize=7B, Tokens (%)=15.02026.03 | — | 56.2 | — | — | |
| FrameFusionSize=7B, Tokens (%)=25.02026.03 | — | 54.8 | — | — | |
| FrameFusionSize=7B, Tokens (%)=15.02026.03 | — | 53 | — | — | |
| LLaVA-OneVision 16 framesLLM Size=7B, Frames=162025.03 | — | 55.7 | — | — | |
| LLaVA-OneVision 16 frames + BOLTLLM Size=7B, Frames=162025.03 | — | 57 | — | — | |
| LLaVA-OneVision 32 framesLLM Size=7B, Frames=322025.03 | — | 56.4 | — | — | |
| LLaVA-OneVision 32 frames + BOLTLLM Size=7B, Frames=322025.03 | — | 59.6 | — | — | |
| LLaVA-OneVision 8 framesLLM Size=7B, Frames=82025.03 | — | 54.2 | — | — | |
| LLaVA-OneVision 8 frames + BOLTLLM Size=7B, Frames=82025.03 | — | 55.6 | — | — | |
| LLaVA-OneVision-7BSize=7B, Tokens (%)=1002026.03 | — | 56.6 | — | — | |
| PruneVidSize=7B, Tokens (%)=25.02026.03 | — | 55.1 | — | — | |
| PruneVidSize=7B, Tokens (%)=15.02026.03 | — | 55.6 | — | — | |
| SemVIDSize=7B, Tokens (%)=25.02026.03 | — | 56.4 | — | — | |
| SemVIDSize=7B, Tokens (%)=15.02026.03 | — | 56.4 | — | — | |
| ShareGPT4VideoLLM Size=8B2025.03 | — | 41.8 | — | — | |
| VanillaSize=7B, Tokens (%)=1002026.03 | — | 56.6 | — | — | |
| Video-LLaVALLM Size=7B2025.03 | — | 39.1 | — | — | |
| VideoChat2LLM Size=7B2025.03 | — | 39.3 | — | — | |
| VisionZipSize=7B, Tokens (%)=25.02026.03 | — | 56 | — | — | |
| VisionZipSize=7B, Tokens (%)=15.02026.03 | — | 54.2 | — | — |