Action Recognition on HA-ViD LH v1.0 (test)
62.4Top-1 AccuracyUniFormerV2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UniFormerV2Model architecture=Separate models per hand2026.05 | 62.4 | 89.7 | |
| VideoMAE V2Model architecture=Separate models per hand2026.05 | 62.1 | 89 | |
| MViTv2Model architecture=Separate models per hand2026.05 | 61.5 | 86.3 | |
| TSMModel architecture=Separate models per hand2026.05 | 61 | 88.5 | |
| ADH-ViT (both)Model architecture=One unified model, Sampling strategy=Segmentation-based and random clip sampling2026.05 | 60.1 | 90.4 | |
| TimeSformerModel architecture=Separate models per hand2026.05 | 52.1 | 85.4 | |
| I3DModel architecture=Separate models per hand2026.05 | 47.7 | 71.5 | |
| ADH-ViT (seg)Model architecture=One unified model, Sampling strategy=Segmentation-based only2026.05 | 47 | 75.6 |