Video Grounding on CharadesSTA (Accuracy)
61.4Accuracy (CharadesSTA)Penguin-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Penguin-VLModel Size=8B2026.03 | 61.4 | |
| Qwen3-VLModel Size=8B2026.03 | 56 | |
| AdaSparkModel Size=Mid Size, Backbone=Qwen-2.5-VL-7B, SFT=true2026.04 | 55.3 | |
| Qwen-2.5-VL-7B + SFTModel Size=Mid Size, SFT=true2026.04 | 53.9 | |
| ToMeModel Size=Mid Size, Backbone=Qwen-2.5-VL-7B, SFT=true2026.04 | 53.5 | |
| Qwen-2.5-VL-7BModel Size=Mid Size, SFT=false2026.04 | 52.4 | |
| FastVModel Size=Mid Size, Backbone=Qwen-2.5-VL-7B, SFT=true2026.04 | 51.3 | |
| FrameFusionModel Size=Mid Size, Backbone=Qwen-2.5-VL-7B, SFT=true2026.04 | 51.3 | |
| MoBAModel Size=Mid Size, Backbone=Qwen-2.5-VL-7B, SFT=true2026.04 | 50.7 | |
| VideoChat-Flash-2BModel Size=Small Size2026.04 | 45.2 | |
| AdaSparkModel Size=Small Size, Backbone=Qwen-2.5-VL-3B, SFT=true2026.04 | 45 | |
| Qwen-2.5-VL-3B + SFTModel Size=Small Size, SFT=true2026.04 | 43.6 | |
| ToMeModel Size=Small Size, Backbone=Qwen-2.5-VL-3B, SFT=true2026.04 | 43.3 | |
| Qwen-2.5-VL-3BModel Size=Small Size, SFT=false2026.04 | 42.6 | |
| FrameFusionModel Size=Small Size, Backbone=Qwen-2.5-VL-3B, SFT=true2026.04 | 41.4 | |
| FastVModel Size=Small Size, Backbone=Qwen-2.5-VL-3B, SFT=true2026.04 | 41.1 | |
| MoBAModel Size=Small Size, Backbone=Qwen-2.5-VL-3B, SFT=true2026.04 | 40.1 | |
| InternVL-3.5Model Size=8B2026.03 | 32.8 | |
| OpenAI GPT-5 nanoModel Size=nano2026.03 | 5 |