Action Grounding on Daly (test)
84.53AccuracyVideoGEM
Evaluation Results
| Method | Links | |
|---|---|---|
| VideoGEMBackbone=CLIP, Backbone Pretraining Data=WIT-400M, Grounding Training Data=None, Grounding Supervision Type=no training for grounding2025.03 | 84.53 | |
| VideoGEMBackbone=OpenCLIP, Backbone Pretraining Data=LAION2B, Grounding Training Data=None, Grounding Supervision Type=no training for grounding2025.03 | 80.32 | |
| GEMBackbone=CLIP, Backbone Pretraining Data=WIT-400M, Grounding Training Data=None, Grounding Supervision Type=no training for grounding2025.03 | 78.52 | |
| VideoGEMBackbone=ViCLIP, Backbone Pretraining Data=InternVid-FLT-10M, Grounding Training Data=None, Grounding Supervision Type=no training for grounding2025.03 | 78.25 | |
| GEMBackbone=OpenCLIP, Backbone Pretraining Data=LAION2B, Grounding Training Data=None, Grounding Supervision Type=no training for grounding2025.03 | 74.05 | |
| GEMBackbone=ViCLIP, Backbone Pretraining Data=InternVid-FLT-10M, Grounding Training Data=None, Grounding Supervision Type=no training for grounding2025.03 | 73.75 | |
| WWW-CLIPBackbone=CLIP*, Backbone Pretraining Data=WIT-400M, Grounding Training Data=HT100M, Grounding Supervision Type=vision-text pairs only2025.03 | 71.35 | |
| WWW-CLIPBackbone=CLIP, Backbone Pretraining Data=WIT-400M, Grounding Training Data=HT100M, Grounding Supervision Type=vision-text pairs only2025.03 | 70.08 | |
| RegionCLIPBackbone=RN50x4*, Backbone Pretraining Data=WIT-400M, Grounding Training Data=CC3M, Grounding Supervision Type=vision-text pairs only2025.03 | 67.12 | |
| COMMABackbone=CLIP, Backbone Pretraining Data=WIT-400M, Grounding Training Data=HT100M, Grounding Supervision Type=vision-text pairs only2025.03 | 61.06 | |
| VideoGrounding-DINOBackbone=Swin-L; BERT, Backbone Pretraining Data=O365, OI, GoldG, Cap4M, COCO, RefC, Grounding Training Data=VidSTG, Grounding Supervision Type=localization supervision2025.03 | 57.73 | |
| STCATBackbone=ResNet101, RoBERTa, Backbone Pretraining Data=None Specified, Grounding Training Data=VidSTG, Grounding Supervision Type=localization supervision2025.03 | 55.9 | |
| TubeDETRBackbone=ResNet101, RoBERTa, Backbone Pretraining Data=ImageNet, Visual Genome, Flickr, COCO, Grounding Training Data=VidSTG, Grounding Supervision Type=localization supervision2025.03 | 51.63 |