Action Recognition on HA-ViD RH v1.0 (test)
62.6Top-1 AccuracyVideoMAE V2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VideoMAE V2Model architecture=Separate models per hand2026.05 | 62.6 | 88.3 | |
| UniFormerV2Model architecture=Separate models per hand2026.05 | 61.4 | 89.9 | |
| ADH-ViT (both)Model architecture=One unified model, Sampling strategy=Segmentation-based and random clip sampling2026.05 | 61.4 | 88.9 | |
| MViTv2Model architecture=Separate models per hand2026.05 | 58.7 | 84.1 | |
| TSMModel architecture=Separate models per hand2026.05 | 58.6 | 87.9 | |
| I3DModel architecture=Separate models per hand2026.05 | 52.9 | 85.1 | |
| TimeSformerModel architecture=Separate models per hand2026.05 | 51.8 | 84.4 | |
| ADH-ViT (seg)Model architecture=One unified model, Sampling strategy=Segmentation-based only2026.05 | 46.2 | 74.3 |