Pose Estimation on COCO (val)
79.6APPoseur
Evaluation Results
| Method | Links | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| PoseurBackbone / Type=HRFormer-B, Input Size=384 x 288, GFLOPs=27.4, Number of decoder layers=62022.01 | 79.6 | 92.1 | 85.9 | 72.9 | 82.9 | — | — | — | — | — | — | — | — | — | — | |
| OmniPose (WASPv2)Input Size=384x288, Params (M)=68.1, GFLOPS=37.92021.03 | 79.5 | 93.6 | 85.9 | 76 | 84.6 | 81.9 | — | — | — | — | — | — | — | — | — | |
| ViTPose-HBackbone=ViT-H, Params (M)=632, Speed (fps)=241, Input Resolution=256x192, Feature Resolution=1/16, Multi-dataset training=true2022.04 | 79.5 | — | — | — | — | 84.5 | — | — | — | — | — | — | — | — | — | |
| OmniPose (WASP)Input Size=384x288, Params (M)=68.2, GFLOPS=38.62021.03 | 79.2 | 93.6 | 85.7 | 75.9 | 84.2 | 81.6 | — | — | — | — | — | — | — | — | — | |
| UDPv1+AIDBackbone=HRNet-W48plus, Input size=384 x 288, Paradigm=Top-down2020.08 | 79.1 | 92.2 | 85.3 | 75.4 | 85.7 | 84.1 | — | — | 82.3 | 71.8 | — | — | — | — | — | |
| ViTPose-HBackbone=ViT-H, Params (M)=632, Speed (fps)=241, Input Resolution=256x192, Feature Resolution=1/16, Multi-dataset training=false2022.04 | 79.1 | — | — | — | — | 84.1 | — | — | — | — | — | — | — | — | — | |
| PoseurBackbone / Type=HRFormer-B, Input Size=256 x 192, GFLOPs=12.6, Number of decoder layers=62022.01 | 78.9 | 92 | 85.7 | 72.3 | 81.7 | — | — | — | — | — | — | — | — | — | — | |
| MIPNetBackbone=HRNet-W48, Input Resolution=384x288, Parameters=63.7M, Bounding Box=Ground Truth2021.01 | 78.8 | 94.4 | 85.7 | 75.5 | 83.7 | 81.6 | — | — | — | — | — | — | — | — | — | |
| PoseurBackbone / Type=HRNet-W48, Input Size=384 x 288, GFLOPs=33.6, Number of decoder layers=62022.01 | 78.8 | 91.6 | 85.1 | 72.1 | 81.8 | — | — | — | — | — | — | — | — | — | — | |
| BMPv2 2xDetection Approach=top-down, Detector=RTMDet-l, Iterative refinement=2x2026.01 | 78.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTPose-LBackbone=ViT-L, Model Category=Specialist, Input Resolution=256×192, Evaluation Protocol=Our implementation2023.12 | 78.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hulk-FTBackbone=ViT-L, Model Category=Generalist, Input Resolution=256×192, Evaluation Protocol=Fine-tuned2023.12 | 78.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTPose-LBackbone=ViT-L, Input Resolution=256x192, Implementation=Our implementation2023.12 | 78.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hulk-FTBackbone=ViT-L, Input Resolution=256x192, Fine-tuned=true2023.12 | 78.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UDPv1+AIDBackbone=HRNet-W32, Input size=384 x 288, Paradigm=Top-down2020.08 | 78.7 | 92.2 | 85 | 75 | 85.1 | 83.6 | — | — | 81.9 | 71.4 | — | — | — | — | — | |
| ViTPose-LBackbone=ViT-L, Params (M)=307, Speed (fps)=411, Input Resolution=256x192, Feature Resolution=1/16, Multi-dataset training=true2022.04 | 78.7 | — | — | — | — | 83.8 | — | — | — | — | — | — | — | — | — | |
| ViTPose++-LBackbone=ViT-L, Input Resolution=256x192, Multiple Datasets=true2023.12 | 78.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UDPv1Backbone=HRNet-W48plus, Input size=384 x 288, Paradigm=Top-down2020.08 | 78.5 | 91.9 | 84.9 | 74.6 | 85.2 | 83.6 | — | — | 81.7 | 71.5 | — | — | — | — | — | |
| MIPNetBackbone=HRNet-W32, Input Resolution=384x288, Parameters=28.6M, Bounding Box=Ground Truth2021.01 | 78.5 | 94.4 | 85.7 | 75.6 | 83 | 81.4 | — | — | — | — | — | — | — | — | — | |
| UDPv1+AIDBackbone=HRNet-W48, Input size=256 x 192, Paradigm=Top-down2020.08 | 78.4 | 92.3 | 84.9 | 75.1 | 84.6 | 83.4 | — | — | 81.7 | 70.8 | — | — | — | — | — | |
| ViTPose-LBackbone=ViT-L, Model Category=Specialist, Input Resolution=256×1922023.12 | 78.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HulkBackbone=ViT-L, Model Category=Generalist, Input Resolution=256×192, Evaluation Protocol=Direct2023.12 | 78.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTPose-LBackbone=ViT-L, Input Resolution=256x1922023.12 | 78.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HulkBackbone=ViT-L, Input Resolution=256x192, Fine-tuned=false2023.12 | 78.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTPose-LBackbone=ViT-L, Params (M)=307, Speed (fps)=411, Input Resolution=256x192, Feature Resolution=1/16, Multi-dataset training=false2022.04 | 78.3 | — | — | — | — | 83.5 | — | — | — | — | — | — | — | — | — | |
| UDPv1+AIDBackbone=2xRSN-50, Input size=256 x 192, Paradigm=Top-down2020.08 | 78.2 | 92.1 | 84.7 | 74.6 | 84.6 | 83.4 | — | — | 81.5 | 70.7 | — | — | — | — | — | |
| HRNetBackbone=HRNet-W48, Input Resolution=384x288, Parameters=63.6M, Bounding Box=Ground Truth2021.01 | 78.1 | 93.6 | 84.9 | 75.3 | 83.1 | 80.9 | — | — | — | — | — | — | — | — | — | |
| BMPv2+ 2xDetection Approach=top-down, Detector=RTMDet-l, Iterative refinement=2x2026.01 | 78.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UDPv1Backbone=HRNet-W32, Input size=384 x 288, Paradigm=Top-down2020.08 | 77.9 | 91.7 | 83.9 | 74.1 | 84.5 | 83.1 | — | — | 81.4 | 70.5 | — | — | — | — | — | |
| BUCTD-preNet-W48Input Source=PETR, Backbone=W48, generative sampling=true2023.06 | 77.8 | — | — | 74.2 | 83.7 | — | — | — | — | — | — | — | — | — | — | |
| UDPv1+AIDBackbone=HRNet-W32, Input size=256 x 192, Paradigm=Top-down2020.08 | 77.8 | 92.1 | 84.5 | 74.1 | 84.1 | 82.8 | — | — | 81.1 | 70.3 | — | — | — | — | — | |
| UDPv1Backbone=HRNet-W48, Input size=256 x 192, Paradigm=Top-down2020.08 | 77.8 | 92 | 84.2 | 74.4 | 84.1 | 83 | — | — | 81.3 | 70.3 | — | — | — | — | — | |
| UDP-PoseBackbone / Type=HRNet-W48, Input Size=384 x 288, GFLOPs=33, Number of decoder layers=N/A (Heatmap-based)2022.01 | 77.8 | 92 | 84.3 | 74.2 | 84.5 | — | — | — | — | — | — | — | — | — | — | |
| UDPv1Backbone=2xRSN-50, Input size=256 x 192, Paradigm=Top-down2020.08 | 77.7 | 91.7 | 84.7 | 74.3 | 84.2 | 83.3 | — | — | 81 | 70.8 | — | — | — | — | — | |
| HRNetBackbone=HRNet-W32, Input Resolution=384x288, Parameters=28.5M, Bounding Box=Ground Truth2021.01 | 77.7 | 93.6 | 84.7 | 74.8 | 82.5 | 80.4 | — | — | — | — | — | — | — | — | — | |
| MIPNetBackbone=HRNet-W32, Input Resolution=256x192, Parameters=28.6M, Bounding Box=Ground Truth2021.01 | 77.6 | 94.4 | 85.3 | 74.7 | 81.9 | 80.6 | — | — | — | — | — | — | — | — | — | |
| MIPNetBackbone=HRNet-W48, Input Resolution=256x192, Parameters=63.7M, Bounding Box=Ground Truth2021.01 | 77.6 | 94.4 | 85.4 | 74.6 | 82.1 | 80.6 | — | — | — | — | — | — | — | — | — | |
| Hulk-FTBackbone=ViT-B, Model Category=Generalist, Input Resolution=256×192, Evaluation Protocol=Fine-tuned2023.12 | 77.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Hulk-FTBackbone=ViT-B, Input Resolution=256x192, Fine-tuned=true2023.12 | 77.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PoseFixBackbone=HRNet-preNet-W48, generative sampling=true2023.06 | 77.3 | — | — | 73.5 | 84.4 | — | — | — | — | — | — | — | — | — | — | |
| ViTPose*-BDetection Approach=top-down, Detector=RTMDet-l2026.01 | 77.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UDPv1Backbone=HRNet-W32, Input size=256 x 192, Paradigm=Top-down2020.08 | 77.2 | 91.6 | 84.2 | 73.7 | 83.7 | 82.5 | — | — | 80.7 | 69.4 | — | — | — | — | — | |
| HRFormer-Binput size=384 × 288, #param.=43.2M, FLOPS=26.8G2021.10 | 77.2 | 91 | 83.6 | 73.2 | 84.2 | 82 | — | — | — | — | — | — | — | — | — | |
| HRFormerBackbone / Type=HRFormer-B, Input Size=384 x 288, GFLOPs=26.8, Number of decoder layers=N/A (Heatmap-based)2022.01 | 77.2 | 91 | 83.6 | 73.2 | 84.2 | — | — | — | — | — | — | — | — | — | — | |
| UDPBackbone=HRNet-W48, Params (M)=64, Speed (fps)=309, Input Resolution=384x288, Feature Resolution=1/42022.04 | 77.2 | — | — | — | — | 82 | — | — | — | — | — | — | — | — | — | |
| HRFormer-BBackbone=HRFormer-B, Params (M)=43, Speed (fps)=78, Input Resolution=384x288, Feature Resolution=1/42022.04 | 77.2 | — | — | — | — | 82 | — | — | — | — | — | — | — | — | — | |
| ViTPose-BBackbone=ViT-B, Model Category=Specialist, Input Resolution=256×192, Evaluation Protocol=Our implementation2023.12 | 77.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PATHBackbone=ViT-L, Model Category=Pretraining, Input Resolution=256×1922023.12 | 77.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTPose-BBackbone=ViT-B, Input Resolution=256x192, Implementation=Our implementation2023.12 | 77.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PATHBackbone=ViT-L, Input Resolution=256x1922023.12 | 77.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BUCTD-COAM-W48Input Source=PETR, Backbone=W48, generative sampling=true2023.06 | 77.1 | — | — | 73.3 | 83.4 | — | — | — | — | — | — | — | — | — | — | |
| HRNetBackbone=HRNet-W48, Input Resolution=256x192, Parameters=63.6M, Bounding Box=Ground Truth2021.01 | 77.1 | 93.6 | 84.7 | 74.1 | 81.9 | 79.9 | — | — | — | — | — | — | — | — | — | |
| ViTPose-BBackbone=ViT-B, Params (M)=86, Speed (fps)=944, Input Resolution=256x192, Feature Resolution=1/16, Multi-dataset training=true2022.04 | 77.1 | — | — | — | — | 82.2 | — | — | — | — | — | — | — | — | — | |
| ViTPose-BMulti-dataset training=true2023.03 | 77.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HAPBackbone=ViT-B, Model Category=Pretraining, Input Resolution=256×1922023.12 | 77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HulkBackbone=ViT-B, Model Category=Generalist, Input Resolution=256×192, Evaluation Protocol=Direct2023.12 | 77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTPose++-BBackbone=ViT-B, Input Resolution=256x192, Multiple Datasets=true2023.12 | 77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HAPBackbone=ViT-B, Input Resolution=256x1922023.12 | 77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HulkBackbone=ViT-B, Input Resolution=256x192, Fine-tuned=false2023.12 | 77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MIPNetBackbone=ResNet-152, Input Resolution=384x288, Parameters=69.6M, Bounding Box=Ground Truth2021.01 | 77 | 93.5 | 84.3 | 73.7 | 81.9 | 80 | — | — | — | — | — | — | — | — | — | |
| HCMoCoBackbone=HRNet-W48, Model Category=Pretraining, Input Resolution=256×1922023.12 | 76.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HCMoCoBackbone=HRNet-W48, Input Resolution=256x192, Implementation=Our implementation2023.12 | 76.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PoseurBackbone / Type=HRNet-W32, Input Size=256 x 192, GFLOPs=7.4, Number of decoder layers=62022.01 | 76.9 | 91 | 83.5 | 70.1 | 79.7 | — | — | — | — | — | — | — | — | — | — | |
| PMPose-BDetection Approach=top-down, Detector=RTMDet-l2026.01 | 76.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DarkPoseInput Size=384x288, Params (M)=63.6, GFLOPS=32.92021.03 | 76.8 | 90.6 | 83.2 | 72.8 | 84 | 81.7 | — | — | — | — | — | — | — | — | — | |
| UDP-PoseBackbone / Type=HRNet-W32, Input Size=256 x 192, GFLOPs=7.2, Number of decoder layers=N/A (Heatmap-based)2022.01 | 76.8 | 91.9 | 83.7 | 73.1 | 83.3 | — | — | — | — | — | — | — | — | — | — | |
| MaskPose-BDetection Approach=top-down, Detector=RTMDet-l2026.01 | 76.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SOLDIERBackbone=Swin-B, Model Category=Pretraining, Input Resolution=256×1922023.12 | 76.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniHCP-FTBackbone=ViT-B, Model Category=Generalist, Input Resolution=256×192, Evaluation Protocol=Fine-tuned2023.12 | 76.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SOLDIERBackbone=Swin-B, Input Resolution=256x1922023.12 | 76.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniHCP-FTBackbone=ViT-B, Input Resolution=256x192, Fine-tuned=true2023.12 | 76.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SimpleBaselineBackbone=ResNet-152, Input Resolution=384x288, Parameters=68.6M, Bounding Box=Ground Truth2021.01 | 76.6 | 92.6 | 83.6 | 73.7 | 81.3 | 79.3 | — | — | — | — | — | — | — | — | — | |
| PoseurBackbone / Type=HRFormer-S, Input Size=256 x 192, GFLOPs=3, Number of decoder layers=32022.01 | 76.6 | 91 | 83.4 | 69.8 | 79.4 | — | — | — | — | — | — | — | — | — | — | |
| MaskPose-bMethod Category=Top-down, Detector=RTMDet-L2024.12 | 76.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BBox-Mask-Pose 1xMethod Category=Iterative, Iterations=1x, Detector=RTMDet-L2024.12 | 76.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BBox-Mask-Pose 2xMethod Category=Iterative, Iterations=2x, Detector=RTMDet-L2024.12 | 76.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BUCTD-COAM-W48Input Source=HRNet-W48, Backbone=W48, generative sampling=true2023.06 | 76.5 | — | — | 72.7 | 83.2 | — | — | — | — | — | — | — | — | — | — | |
| HRNetBackbone=HRNet-W32, Input Resolution=256x192, Parameters=28.5M, Bounding Box=Ground Truth2021.01 | 76.5 | 93.5 | 83.7 | 73.9 | 80.8 | 79.3 | — | — | — | — | — | — | — | — | — | |
| UniHCPEvaluation Protocol=finetune2023.03 | 76.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BMPv1 2xDetection Approach=top-down, Detector=RTMDet-l, Iterative refinement=2x2026.01 | 76.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTPose-BMethod Category=Top-down, Detector=RTMDet-L2024.12 | 76.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViTPose-BDetection Approach=top-down, Detector=RTMDet-l2026.01 | 76.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MIPNetMethod Category=Top-down2024.12 | 76.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PATHBackbone=ViT-B, Model Category=Pretraining, Input Resolution=256×1922023.12 | 76.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PATHBackbone=ViT-B, Input Resolution=256x1922023.12 | 76.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HRNet-W48Backbone=W482023.06 | 76.3 | — | — | 72.3 | 83.4 | — | — | — | — | — | — | — | — | — | — | |
| MIPNet-W48Backbone=W482023.06 | 76.3 | — | — | 72.3 | 83.4 | — | — | — | — | — | — | — | — | — | — | |
| HRNetInput Size=384x288, Params (M)=63.6, GFLOPS=32.92021.03 | 76.3 | 90.8 | 82.9 | 72.3 | 83.4 | 81.2 | — | — | — | — | — | — | — | — | — | |
| HRNetBackbone=HRNet-W48-384, Detector=Faster R-CNN, Paradigm=Top-Down2021.01 | 76.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MIPNetBackbone=HRNet-W48-384, Detector=Faster R-CNN, Paradigm=Top-Down2021.01 | 76.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HRNet-W48input size=384 x 288, #param.=63.6M, FLOPS=32.9G2021.10 | 76.3 | 90.8 | 82.9 | 72.3 | 83.4 | 81.2 | — | — | — | — | — | — | — | — | — | |
| HRNetBackbone / Type=HRNet-W48, Input Size=384 x 288, GFLOPs=32.9, Number of decoder layers=N/A (Heatmap-based)2022.01 | 76.3 | 90.8 | 82.9 | 72.3 | 83.4 | — | — | — | — | — | — | — | — | — | — | |
| PoseurBackbone / Type=ResNet-152, Input Size=256 x 192, GFLOPs=11.9, Number of decoder layers=62022.01 | 76.3 | 91.1 | 83.3 | 69.1 | 79.5 | — | — | — | — | — | — | — | — | — | — | |
| HRNetBackbone=HRNet-W48, Params (M)=64, Speed (fps)=309, Input Resolution=384x288, Feature Resolution=1/42022.04 | 76.3 | — | — | — | — | 81.2 | — | — | — | — | — | — | — | — | — | |
| MIPNetDetection Approach=top-down, Detector=other2026.01 | 76.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DARKFramework=Top-down with crop operation, Backbone=HRNet-W48, Utilize pre-trained detector=true2022.09 | 76.2 | 92.5 | 83.6 | 72.5 | 82.4 | 81.1 | — | — | — | — | — | — | — | — | — | |
| UniHCPBackbone=ViT-B, Model Category=Generalist, Input Resolution=256×192, Evaluation Protocol=Direct2023.12 | 76.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniHCPBackbone=ViT-B, Input Resolution=256x192, Fine-tuned=false2023.12 | 76.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniHCPEvaluation Protocol=direct eval2023.03 | 76.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BUCTD-TP-H-A6Input Source=PETR, Backbone=TP-H-A6, generative sampling=true2023.06 | 76 | — | — | 72.2 | 82.3 | — | — | — | — | — | — | — | — | — | — |