Action Grounding on V-HICO (test)
84.2AccuracyQwen-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen-VLPrompt Template=Generate grounding for2025.03 | 84.2 | |
| VideoGEMBackbone=CLIP, Backbone Pretraining Data=WIT-400M, Grounding Training Data=None, Grounding Supervision Type=no training for grounding2025.03 | 76.9 | |
| VideoGEMBackbone=OpenCLIP, Backbone Pretraining Data=LAION2B, Grounding Training Data=None, Grounding Supervision Type=no training for grounding2025.03 | 76.42 | |
| VideoGEMBackbone=ViCLIP, Backbone Pretraining Data=InternVid-FLT-10M, Grounding Training Data=None, Grounding Supervision Type=no training for grounding2025.03 | 75.75 | |
| VideoGEMBackbone=ViCLIP, Input Type=video2025.03 | 75.74 | |
| GEMBackbone=OpenCLIP, Backbone Pretraining Data=LAION2B, Grounding Training Data=None, Grounding Supervision Type=no training for grounding2025.03 | 68.28 | |
| GEMBackbone=CLIP, Backbone Pretraining Data=WIT-400M, Grounding Training Data=None, Grounding Supervision Type=no training for grounding2025.03 | 67.79 | |
| GLIPBackbone=Swin-L*, Backbone Pretraining Data=FourODs, GoldG, Cap24M, Grounding Training Data=None, Grounding Supervision Type=localization supervision2025.03 | 66.05 | |
| GEMBackbone=ViCLIP, Backbone Pretraining Data=InternVid-FLT-10M, Grounding Training Data=None, Grounding Supervision Type=no training for grounding2025.03 | 65.08 | |
| WWW-CLIPBackbone=CLIP*, Backbone Pretraining Data=WIT-400M, Grounding Training Data=HT100M, Grounding Supervision Type=vision-text pairs only2025.03 | 62.34 | |
| WWW-CLIPBackbone=CLIP, Backbone Pretraining Data=WIT-400M, Grounding Training Data=HT100M, Grounding Supervision Type=vision-text pairs only2025.03 | 60.71 | |
| RegionCLIPBackbone=RN50x4*, Backbone Pretraining Data=WIT-400M, Grounding Training Data=CC3M, Grounding Supervision Type=vision-text pairs only2025.03 | 57.92 | |
| COMMABackbone=CLIP, Backbone Pretraining Data=WIT-400M, Grounding Training Data=HT100M, Grounding Supervision Type=vision-text pairs only2025.03 | 55.2 |