Human Pose Estimation on JHMDB (val)
59.2PCK@0.1Supervised
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SupervisedType=Supervised, Backbone=ResNet50 (26M), Epoch=100, Pre-training Dataset=ImageNet-1k2025.03 | 59.2 | 78.3 | |
| T-CoReType=Masked Modeling, Space Type=Latent Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 47 | 75.2 | |
| DINO v2Type=Masked Modeling, Space Type=Latent Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 46.6 | 74.8 | |
| DINO v2Type=Masked Modeling, Space Type=Latent Space, Backbone=ViT-S/16 (22M), Epoch=100, Pre-training Dataset=ImageNet-1k2025.03 | 46.3 | 75.4 | |
| T-CoReType=Masked Modeling, Space Type=Latent Space, Backbone=ViT-S/16 (22M), Epoch=100, Pre-training Dataset=ImageNet-1k2025.03 | 46.2 | 75.5 | |
| SiamMAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 46.1 | 74 | |
| DINOType=Contrastive Learning, Backbone=ViT-S/16 (22M), Epoch=800, Pre-training Dataset=ImageNet-1k2025.03 | 45.6 | 75 | |
| MAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-B/16 (87M), Epoch=1600, Pre-training Dataset=ImageNet-1k2025.03 | 44.6 | 73.4 | |
| RSPType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 44.6 | 73.4 | |
| iBOTType=Masked Modeling, Space Type=Latent Space, Backbone=ViT-S/16 (22M), Epoch=800, Pre-training Dataset=ImageNet-1k2025.03 | 44.5 | 74.5 | |
| iBOTType=Masked Modeling, Space Type=Latent Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 44.5 | 74.2 | |
| CropMAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=ImageNet-1k2025.03 | 43.6 | 72 | |
| RC-MAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=1600, Pre-training Dataset=ImageNet-1k2025.03 | 43.2 | 72.3 | |
| MAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 43 | 71.3 | |
| CropMAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 42.9 | 71.1 | |
| DINOType=Contrastive Learning, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 41.1 | 70.3 | |
| VideoMAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=1600, Pre-training Dataset=Kinetics-4002025.03 | 41 | 67.9 | |
| MoCo v3Type=Contrastive Learning, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 38.4 | 67.6 | |
| SimCLRType=Contrastive Learning, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 37.9 | 66.1 |