Video Question Answering on ActivityNet-QA
71.02AccuracyQwen3-VL + CurEvo
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen3-VL + CurEvoModel Family=Qwen3-VL, Parameters=8B, CurEvo integration=true, Evaluation Model=Qwen2.5-VL(7B)2026.04 | 71.02 | — | 3.93 | — | — | |
| Qwen3-VLModel Family=Qwen3-VL, Parameters=8B, CurEvo integration=false, Evaluation Model=Qwen2.5-VL(7B)2026.04 | 70.41 | — | 3.88 | — | — | |
| Qwen2.5-VL + CurEvoModel Family=Qwen2.5-VL, Parameters=7B, CurEvo integration=true, Evaluation Model=Qwen2.5-VL(7B)2026.04 | 69.91 | — | 3.81 | — | — | |
| Qwen2.5-VLModel Family=Qwen2.5-VL, Parameters=7B, CurEvo integration=false, Evaluation Model=Qwen2.5-VL(7B)2026.04 | 67.84 | — | 3.72 | — | — | |
| InternVL2.5 + CurEvoModel Family=InternVL2.5, Parameters=8B, CurEvo integration=true, Evaluation Model=Qwen2.5-VL(7B)2026.04 | 66.02 | — | 3.9 | — | — | |
| Penguin-VLModel Size=8B2026.03 | 65.2 | — | — | — | — | |
| LLaVA-NeXT-Video-DPOSize=34B2024.07 | 64.4 | — | — | — | — | |
| Video-LLaMA3 + CurEvoModel Family=Video-LLaMA3, Parameters=7B, CurEvo integration=true, Evaluation Model=Qwen2.5-VL(7B)2026.04 | 64.11 | — | 3.61 | — | — | |
| InternVL2.5Model Family=InternVL2.5, Parameters=8B, CurEvo integration=false, Evaluation Model=Qwen2.5-VL(7B)2026.04 | 64.11 | — | 3.84 | — | — | |
| InternVL3-8Bresults reproduced=true2026.03 | 63.9 | — | — | — | — | |
| Qwen3-VLModel Size=8B2026.03 | 63.7 | — | — | — | — | |
| MiniCPM-o-2.62026.03 | 63 | — | — | — | — | |
| InternVL2.5-8Bresults reproduced=true2026.03 | 62.8 | — | — | — | — | |
| Qwen2.5-Omni-7Bresults reproduced=true2026.03 | 62.7 | — | — | — | — | |
| VILA + CurEvoModel Family=VILA, Parameters=7B, CurEvo integration=true, Evaluation Model=Qwen2.5-VL(7B)2026.04 | 62.47 | — | 3.37 | — | — | |
| LLaVA-OneVision + CurEvoModel Family=LLaVA-OneVision, Parameters=7B, CurEvo integration=true, Evaluation Model=Qwen2.5-VL(7B)2026.04 | 62.39 | — | 2.88 | — | — | |
| LLaVA-OVSize=70B, Evaluation Protocol=Zero-shot2025.12 | 62.3 | — | — | — | — | |
| Video-LLaMA3Model Family=Video-LLaMA3, Parameters=7B, CurEvo integration=false, Evaluation Model=Qwen2.5-VL(7B)2026.04 | 62.04 | — | 3.49 | — | — | |
| Baichuan-Omni-1.52026.03 | 62 | — | — | — | — | |
| GPT 4o# Frames=-2024.10 | 61.9 | — | — | — | — | |
| GPT-4o2024.12 | 61.9 | — | — | — | — | |
| GPT-4oSize=—2026.01 | 61.9 | — | — | — | — | |
| Penguin-VLParameters=2B2026.03 | 61.5 | — | — | — | — | |
| PLLaVA 34BVision Encoder=ViT-L, LLM Size=34B2024.04 | 60.9 | — | 3.7 | — | — | |
| NVILANumber of Parameters=8B, #Frames=2562024.12 | 60.9 | — | 3.7 | — | — | |
| NVILASize=8B2026.01 | 60.9 | — | 3.7 | — | — | |
| PPLLaVABase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=true2024.11 | 60.7 | — | 3.6 | — | — | |
| VILAModel Family=VILA, Parameters=7B, CurEvo integration=false, Evaluation Model=Qwen2.5-VL(7B)2026.04 | 60.28 | — | 3.21 | — | — | |
| LLaVA-NeXT-Video-DPOSize=7B2024.07 | 60.2 | — | — | — | — | |
| LLaVA-Next-VideoBase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=true2024.11 | 60.2 | — | 3.5 | — | — | |
| LinMU-NVSize=8B2026.01 | 60.1 | — | 3.6 | — | — | |
| InternVL-3.5Model Size=8B2026.03 | 60.1 | — | — | — | — | |
| Video-CCAMSize=9B, # token/frame=64/10.72024.12 | 59.7 | — | — | — | — | |
| Qwen3-VLParameters=2B2026.03 | 59.7 | — | — | — | — | |
| VITA-1.52026.03 | 59.6 | — | — | — | — | |
| GPT 4V# Frames=-2024.10 | 59.5 | — | — | — | — | |
| LongVILANumber of Parameters=7B, #Frames=2562024.12 | 59.5 | — | — | — | — | |
| GPT4-VVision Encoder=GPT-42025.01 | 59.5 | — | — | — | — | |
| Baichuan-omni (7B)# Frames=1 fps (max 48)2024.10 | 58.6 | — | 3.7 | — | — | |
| LLaVA-OneVisionModel Family=LLaVA-OneVision, Parameters=7B, CurEvo integration=false, Evaluation Model=Qwen2.5-VL(7B)2026.04 | 58.47 | — | 2.53 | — | — | |
| IG-VLM LLaVA 34BVision Encoder=ViT-L, LLM Size=34B2024.04 | 58.4 | — | 3.5 | — | — | |
| LVLMModel Scale=13B2026.01 | 58.3 | — | — | — | — | |
| InternVL3.5Parameters=2B2026.03 | 58.3 | — | — | — | — | |
| Video-CCAMSize=4B, # token/frame=64/10.72024.12 | 58 | — | — | — | — | |
| Gemini-1.5-Pro2024.12 | 57.5 | — | — | — | — | |
| IG-VLM CogAgentVision Encoder=CLIP-E, LLM Size=7B2024.04 | 57.3 | — | 3.6 | — | — | |
| VLM-RLAIFLLM Size=7B, zero-shot=true2024.02 | 57.3 | — | 3.5 | — | — | |
| VLM-RLAIFBase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=true2024.11 | 57.3 | — | 3.5 | — | — | |
| LVLMModel Scale=7B2026.01 | 57.3 | — | — | — | — | |
| IG-VLM LLaVA 13BVision Encoder=ViT-L, LLM Size=13B2024.04 | 57.1 | — | 3.5 | — | — | |
| PVC InternVL2Size=8B, # token/frame=642024.12 | 57.1 | — | — | — | — | |
| PAVE-7B (w/ video feature)FLOPs (TB)=98.63, Total/Trainable Params=8.2B/170.5M2025.03 | 57.1 | — | — | — | — | |
| IG-VLM GPT-4VVision Encoder=Unk, LLM Size=GPT-42024.04 | 57 | — | 3.5 | — | — | |
| GPT-4V2024.12 | 57 | — | — | — | — | |
| BLIP-3-VideoSize=4B, # token/frame=162024.12 | 56.9 | — | — | — | — | |
| Gemini 1.5 Pro# Frames=-2024.10 | 56.7 | — | — | — | — | |
| LLaVA-OVSize=7B, # token/frame=1962024.12 | 56.6 | — | — | — | — | |
| LLaVA-OneVisionNumber of Parameters=8B, #Frames=322024.12 | 56.6 | — | — | — | — | |
| LLaVA-OV-7BFLOPs (TB)=98.53, Total/Trainable Params=8.2B/-2025.03 | 56.6 | — | — | — | — | |
| LLaVA-OVSize=7B2026.01 | 56.6 | — | — | — | — | |
| LLaVA-OneVision-7BParameter Scale=7B2026.02 | 56.6 | — | — | — | — | |
| LLaVA-OV2026.03 | 56.6 | — | — | — | — | |
| LLaVA-VideoSize=7B, # token/frame=1692024.12 | 56.5 | — | — | — | — | |
| LLaVA-Video-7BNum Frame=-, Token/Frame=-, Total Num of Token=>12k2026.04 | 56.5 | — | — | — | — | |
| Show-o2video generation support=true2026.03 | 56.4 | — | — | — | — | |
| PLLaVA 7BVision Encoder=ViT-L, LLM Size=7B2024.04 | 56.3 | — | 3.5 | — | — | |
| PLLaVA 13BVision Encoder=ViT-L, LLM Size=13B2024.04 | 56.3 | — | 3.6 | — | — | |
| PLLaVABase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 56.3 | — | 3.5 | — | — | |
| PLLAVASize=7B, # token/frame=1442024.12 | 56.3 | — | — | — | — | |
| PLLaVAModel Scale=7B2026.01 | 56.3 | — | — | — | — | |
| PLLaVAModel Scale=13B2026.01 | 56.3 | — | — | — | — | |
| Dynin-Omninative speech input/output capability=true2026.03 | 56.3 | — | — | — | — | |
| PLLaVAVision Encoder=ViT-L, LLM Size=7B2025.01 | 56.3 | — | 3.5 | — | — | |
| LLaVA-NeXT-InterleaveSize=14B2024.07 | 56.2 | — | — | — | — | |
| PPLLaVABase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 56.1 | — | 3.4 | — | — | |
| LLaVA-OV-7BNum Frame=64, Token/Frame=-, Total Num of Token=>12k2026.04 | 56 | — | — | — | — | |
| SWIM2026.05 | 55.6 | — | — | — | — | |
| POINTS-Long (standby)Num Frame=64, Token/Frame=8, Total Num of Token=512 (2.5%)2026.04 | 55.4 | — | — | 52.7 | — | |
| InternVL3 + ReFoCUSLLM=8B2025.06 | 55.4 | — | 70.4 | — | — | |
| LLaVA-NeXT-InterleaveSize=7B2024.07 | 55.3 | — | — | — | — | |
| INST-IT2026.05 | 55.2 | — | — | — | — | |
| POINTS-Long (standby)Num Frame=64, Token/Frame=16, Total Num of Token=1024 (5%)2026.04 | 55.1 | — | — | 52.9 | — | |
| LLaVA-NeXT-InterleaveSize=7B, Training Protocol=DPO2024.07 | 55 | — | — | — | — | |
| VITA (8x7B)# Frames=1 fps (max 32)2024.10 | 55 | — | 3.5 | — | — | |
| POINTS-Long (standby)Num Frame=64, Token/Frame=32, Total Num of Token=2048 (10%)2026.04 | 54.7 | — | — | 53.8 | — | |
| POINTS-Long (focus)Num Frame=64, Token/Frame=324+32, Total Num of Token=≈ 22K2026.04 | 54.7 | — | — | 54.4 | — | |
| LLaVA-OV-7BRetain Ratio=100%2026.03 | 54.5 | — | 3.55 | — | — | |
| FiGMo2026.06 | 54.4 | — | 3.6 | — | — | |
| IG-VLM LLaVA 7BVision Encoder=ViT-L, LLM Size=7B2024.04 | 54.3 | — | 3.4 | — | — | |
| POINTS1.5-8B (baseline)Num Frame=64, Token/Frame=324, Total Num of Token=≈ 20K2026.04 | 54.3 | — | — | 53.9 | — | |
| HuMoCon2026.06 | 54.2 | — | 3.6 | — | — | |
| InternVL3LLM=8B, Sampling=Uniform2025.06 | 53.7 | — | 69.4 | — | — | |
| LLaVA-NeXT-VideoSize=7B2024.07 | 53.5 | — | — | — | — | |
| LLaVA-Next-VideoBase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 53.5 | — | 3.2 | — | — | |
| LLaVA-NeXT-Video (7B)# Frames=322024.10 | 53.5 | — | 3.2 | — | — | |
| LLaVA-NeXT-VideoNumber of Parameters=7B, #Frames=322024.12 | 53.5 | — | 3.2 | — | — | |
| LLaVA-Mini#Frames=1fps, #Vision Tokens per Frame=12025.01 | 53.5 | — | 3.5 | — | — | |
| LLaVA-NeXTSize=7B, Evaluation Protocol=Zero-shot2025.12 | 53.5 | — | 3.2 | — | — | |
| LLaVA-Next-Video2026.05 | 53.5 | — | — | — | — | |
| LLaVA-OctopusVision Encoder=SIGLIP, LLM Size=7B2025.01 | 53.4 | — | 3.6 | — | — |