Human Pose Estimation on COCO (val)
82.2APSapiens-2B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Sapiens-2BModel Variant=Body, Pre-trained Backbone=Sapiens ViT, Params=2.163B2025.09 | 82.2 | — | 86 | — | — | |
| Sapiens-1BModel Variant=Body, Pre-trained Backbone=Sapiens ViT, Params=1.169B2025.09 | 82.1 | — | 85.9 | — | — | |
| SDPoseModel Variant=Body, Pre-trained Backbone=Stable Diffusion-v2, Params=0.98B2025.09 | 81.2 | — | 85.3 | — | — | |
| OursNetwork=HRNetW482023.03 | 79.4 | 94.8 | 81.9 | 95.2 | — | |
| DualNetwork=HRNetW482023.03 | 79.2 | 94.6 | 81.7 | 95.1 | — | |
| ViTPose-HBox Detector=Faster RCNN, l. param=637.2M2026.07 | 79.1 | 91.6 | — | — | 85.7 | |
| perceptual diffusion modelBackbone=SD1-52023.12 | 79 | — | 84 | — | — | |
| ViTPose-LBackbone=ViT-L2023.12 | 78.3 | — | 83.5 | — | — | |
| GKDT-HBox Detector=GT box, l. param=898.4M2026.07 | 78.2 | 94.5 | — | — | 84.7 | |
| GKDT-HBox Detector=G-DINO, l. param=898.4M, finetuned=COCO+HumanArt2026.07 | 78.1 | 91.7 | — | — | 85.1 | |
| GenLocModel Variant=Body, Pre-trained Backbone=Stable Diffusion-v1.5, Params=0.98B2025.09 | 77.6 | — | 80.7 | — | — | |
| PoseBHGFLOPS=18.5, Backbone=ViT-Base, Input Resolution=256x1922025.05 | 77.3 | — | — | — | — | |
| SupervisedNetwork=HRNetW482023.03 | 77.2 | 93.5 | 79.9 | 94.1 | — | |
| UDPBackbone=HRNet-W482023.12 | 77.2 | — | 82 | — | — | |
| HRFormer-BBackbone=HRFormer-B2023.12 | 77.2 | — | 82 | — | — | |
| GKDT-HBox Detector=G-DINO, l. param=898.4M2026.07 | 77.2 | 91.6 | — | — | 84.3 | |
| ViTPose++GFLOPS=18.5, Backbone=ViT-Base, Input Resolution=256x1922025.05 | 77 | — | — | — | — | |
| UniHCPGFLOPS=18.9, Backbone=ViT-Base, Input Resolution=256x1922025.05 | 76.8 | — | — | — | — | |
| GKDTBox Detector=GT box, l. param=349.1M2026.07 | 76.5 | 93.7 | — | — | 83.9 | |
| HRNetBackbone=HRNet-W482023.12 | 76.3 | — | 81.2 | — | — | |
| HRNetBackbone=HRNet-W322023.12 | 75.8 | — | 81 | — | — | |
| OursNetwork=ResNet1522023.03 | 75.7 | 93.7 | 78.6 | 94.5 | — | |
| OursNetwork=ResNet1012023.03 | 75.5 | 93.8 | 78.4 | 94.2 | — | |
| DualNetwork=ResNet1522023.03 | 75.5 | 93.6 | 78.5 | 94.3 | — | |
| DualNetwork=ResNet1012023.03 | 75.3 | 93.6 | 78.2 | 94.1 | — | |
| GKDTBox Detector=G-DINO, l. param=349.1M2026.07 | 75 | 90.8 | — | — | 82.3 | |
| OursNetwork=ResNet502023.03 | 74.2 | 92.7 | 77.2 | 93.8 | — | |
| DualNetwork=ResNet502023.03 | 73.9 | 92.5 | 77 | 93.5 | — | |
| SimpleBaselineBackbone=ResNet1522023.12 | 73.5 | — | 79 | — | — | |
| HF-HRNetBackbone=HF-HRNet-30, Pretrain=No, TTA=Yes, Input=384x288, #Params=7.4M, FLOPs=2.5G, Inference time=~7.3FPS (RK3588), RAM=-2025.12 | 73.5 | — | — | — | — | |
| SupervisedNetwork=ResNet1522023.03 | 73.2 | 92.5 | 76.3 | 93.2 | — | |
| GKDTBox Detector=Faster RCNN, l. param=349.1M2026.07 | 73.2 | 88.7 | — | — | 80.1 | |
| SupervisedNetwork=ResNet1012023.03 | 72.5 | 92.5 | 75.6 | 93.1 | — | |
| HF-HRNetBackbone=HF-HRNet-18, Pretrain=No, TTA=Yes, Input=384x288, #Params=4.6M, FLOPs=1.5G, Inference time=~10.3FPS (RK3588), RAM=-2025.12 | 72.4 | — | — | — | — | |
| HRFormerBackbone=HRFormer-T, Pretrain=Yes, TTA=Yes, Input=384x288, #Params=2.5M, FLOPs=1.8G, Inference time=-, RAM=-2025.12 | 72.4 | — | — | — | — | |
| LAPBackbone=Hourglass, Pretrain=No, TTA=Yes, Input=256x192, #Params=2.34M, FLOPs=2.78G, Inference time=~16FPS (APPLE M2 CPU), RAM=~76.1MB2025.12 | 72.1 | — | — | — | — | |
| LAPXBackbone=Hourglass, Pretrain=No, TTA=Yes, Input=384x288, #Params=2.30M, FLOPs=5.82G, Inference time=-, RAM=-2025.12 | 72.1 | — | — | — | — | |
| X-PoseBox Detector=End-to-end, l. param=128.1M, Notes=Reproduced via official released model2026.07 | 71.8 | 88.9 | — | — | 78.3 | |
| Dite-HRNetBackbone=Dite-HRNet-30, Pretrain=No, TTA=Yes, Input=384x288, #Params=1.8M, FLOPs=0.7G, Inference time=~0.5FPS (RK3588), RAM=-2025.12 | 71.5 | — | — | — | — | |
| LAPXBackbone=Hourglass, Pretrain=No, TTA=No, Input=384x288, #Params=2.30M, FLOPs=5.82G, Inference time=-, RAM=-2025.12 | 71.2 | — | — | — | — | |
| LPNBackbone=ResNet-152, Pretrain=No, TTA=Yes, Input=256x192, #Params=7.4M, FLOPs=1.8G, Inference time=11FPS (i7-8700K) / ~17FPS (APPLE M2 CPU), RAM=~90.9MB2025.12 | 71 | — | — | — | — | |
| SupervisedNetwork=ResNet502023.03 | 70.9 | 91.4 | 74.2 | 92.3 | — | |
| HRFormerBackbone=HRFormer-T, Pretrain=Yes, TTA=Yes, Input=256x192, #Params=2.5M, FLOPs=1.3G, Inference time=~13FPS (APPLE M2 CPU), RAM=~83.8MB2025.12 | 70.9 | — | — | — | — | |
| LAPBackbone=Hourglass, Pretrain=No, TTA=Yes, Input=384x288, #Params=2.34M, FLOPs=6.24G, Inference time=-, RAM=-2025.12 | 70.9 | — | — | — | — | |
| HF-HRNetBackbone=HF-HRNet-30, Pretrain=No, TTA=Yes, Input=256x192, #Params=7.4M, FLOPs=1.1G, Inference time=~14.8FPS (RK3588), RAM=-2025.12 | 70.8 | — | — | — | — | |
| LAPXBackbone=Hourglass, Pretrain=No, TTA=Yes, Input=256x192, #Params=2.30M, FLOPs=2.59G, Inference time=~15FPS (APPLE M2 CPU), RAM=~58.0MB2025.12 | 70.6 | — | — | — | — | |
| LMFormerBackbone=LMFormer-L, Pretrain=No, TTA=No, Input=384x288, #Params=4.1M, FLOPs=3.5G, Inference time=-, RAM=-2025.12 | 70.5 | — | — | — | — | |
| LPNBackbone=ResNet-101, Pretrain=No, TTA=Yes, Input=256x192, #Params=5.3M, FLOPs=1.4G, Inference time=14FPS (i7-8700K) / ~24FPS (APPLE M2 CPU), RAM=~69.6MB2025.12 | 70.4 | — | — | — | — | |
| Lite-HRNetBackbone=Lite-HRNet-30, Pretrain=No, TTA=Yes, Input=384x288, #Params=1.8M, FLOPs=0.7G, Inference time=~0.8FPS (RK3588), RAM=-2025.12 | 70.4 | — | — | — | — | |
| ViTPose-LBackbone=ViT-L, Paradigm=Bottom-up, Input Resolution=512x512, Feature Resolution=1/8, Attention Mechanism=full window-based2022.12 | 70.1 | 88.3 | 74.5 | 90.2 | — | |
| LAPXBackbone=Hourglass, Pretrain=No, TTA=No, Input=256x192, #Params=2.30M, FLOPs=2.59G, Inference time=~30FPS (APPLE M2 CPU), RAM=~58.0MB2025.12 | 69.8 | — | — | — | — | |
| HF-HRNetBackbone=HF-HRNet-18, Pretrain=No, TTA=Yes, Input=256x192, #Params=4.6M, FLOPs=0.7G, Inference time=~23.1FPS (RK3588) / ~15FPS (APPLE M2 CPU), RAM=~72.6MB2025.12 | 69.7 | — | — | — | — | |
| LPNBackbone=ResNet-50, Pretrain=No, TTA=Yes, Input=256x192, #Params=2.90M, FLOPs=1.0G, Inference time=17FPS (i7-8700K) / ~35FPS (APPLE M2 CPU), RAM=~51.5MB2025.12 | 69.1 | — | — | — | — | |
| LMFormerBackbone=LMFormer-L, Pretrain=No, TTA=No, Input=256x192, #Params=4.1M, FLOPs=1.4G, Inference time=-, RAM=-2025.12 | 68.9 | — | — | — | — | |
| HigherHRNet-w48Backbone=HRNet-w48, Paradigm=Bottom-up2022.12 | 68.6 | 87.3 | 73.1 | 89.2 | — | |
| ViTPose-BBackbone=ViT-B, Paradigm=Bottom-up, Input Resolution=512x512, Feature Resolution=1/8, Attention Mechanism=full window-based2022.12 | 68.5 | 87.3 | 72.9 | 89.2 | — | |
| Dite-HRNetBackbone=Dite-HRNet-30, Pretrain=No, TTA=Yes, Input=256x192, #Params=1.8M, FLOPs=0.3G, Inference time=~1.3FPS (RK3588), RAM=-2025.12 | 68.3 | — | — | — | — | |
| HigherHRNet-w32Backbone=HRNet-w32, Paradigm=Bottom-up2022.12 | 67.7 | 87 | 72.3 | 89 | — | |
| Lite-HRNetBackbone=Lite-HRNet-30, Pretrain=No, TTA=Yes, Input=256x192, #Params=1.8M, FLOPs=0.31G, Inference time=~1.9FPS (RK3588), RAM=-2025.12 | 67.2 | — | — | — | — | |
| EL-HRNetBackbone=EL-HRNet-W32, Pretrain=No, TTA=No, Input=256x192, #Params=5.0M, FLOPs=2.0G, Inference time=-, RAM=-2025.12 | 67.1 | — | — | — | — | |
| PifpafBackbone=ResNet-50, Paradigm=Bottom-up2022.12 | 62.6 | — | — | — | — | |
| Associate EmbeddingBackbone=Hourglass, Paradigm=Bottom-up2022.12 | 61.3 | 83.3 | 65.9 | 85 | — | |
| Associate EmbeddingBackbone=ResNet-152, Paradigm=Bottom-up2022.12 | 59.5 | 82.9 | 65.1 | 85.6 | — | |
| Associate EmbeddingBackbone=ResNet-101, Paradigm=Bottom-up2022.12 | 55.4 | 80.7 | 62.2 | 84.1 | — | |
| Associate EmbeddingBackbone=ResNet-50, Paradigm=Bottom-up2022.12 | 46.6 | 74.2 | 56.6 | 81 | — |