Pose Estimation on OCHuman (test)
93.3APViTPose-G
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ViTPose-GBackbone=ViTAE-G, Resolution=576x432, Ground truth bounding boxes=true2022.04 | 93.3 | — | 96.8 | 94.3 | 97 | |
| ViTPose-HBackbone=ViT-H, Resolution=256x192, Ground truth bounding boxes=true2022.04 | 90.3 | — | 95.9 | 91.7 | 96.6 | |
| ViTPose-LBackbone=ViT-L, Resolution=256x192, Ground truth bounding boxes=true2022.04 | 90.1 | — | 95.9 | 91.6 | 96.4 | |
| UniHCPEvaluation Protocol=direct eval2023.03 | 87.4 | — | — | — | — | |
| ViTPose-BBackbone=ViT-B, Resolution=256x192, Ground truth bounding boxes=true2022.04 | 87.3 | — | 95.9 | 89 | 96 | |
| ViTPose-BMulti-dataset training=true2023.03 | 87.3 | — | — | — | — | |
| Ours-HBackbone=Huge, Cropping Strategy=Ground-truth bounding boxes, Pre-training=COCO-trained2025.05 | 87 | — | — | — | — | |
| ViTPose++-HBackbone=Huge, Cropping Strategy=Ground-truth bounding boxes, Pre-training=COCO-trained2025.05 | 86.8 | — | — | — | — | |
| BMPv2+ 2xDetection Approach=top-down, Detector=RTMDet-l, Iterative refinement=2x2026.01 | 86.8 | — | — | — | — | |
| ViTPose++-LBackbone=ViT-L, Resolution=256x1922022.12 | 85.7 | — | 92.8 | 87.5 | 93.4 | |
| ViTPose++-HBackbone=ViT-H, Resolution=256x1922022.12 | 85.7 | — | 92.8 | 87.4 | 93.8 | |
| BMPv2 2xDetection Approach=top-down, Detector=RTMDet-l, Iterative refinement=2x2026.01 | 83.4 | — | — | — | — | |
| Ours-BBackbone=Base, Cropping Strategy=Ground-truth bounding boxes, Pre-training=COCO-trained2025.05 | 83.1 | — | — | — | — | |
| ViTPose++-BBackbone=ViT-B, Resolution=256x1922022.12 | 82.6 | — | 91.7 | 84.6 | 92.4 | |
| ViTPose++-BBackbone=Base, Cropping Strategy=Ground-truth bounding boxes, Pre-training=COCO-trained2025.05 | 82 | — | — | — | — | |
| PMPose-BDetection Approach=top-down, Detector=RTMDet-l2026.01 | 80 | — | — | — | — | |
| BMPv1 2xDetection Approach=top-down, Detector=RTMDet-l, Iterative refinement=2x2026.01 | 79.9 | — | — | — | — | |
| ViTPose++-SBackbone=ViT-S, Resolution=256x1922022.12 | 78.4 | — | 90.6 | 80.6 | 91 | |
| MaskPose-BDetection Approach=top-down, Detector=RTMDet-l2026.01 | 78 | — | — | — | — | |
| ViTPose*-BDetection Approach=top-down, Detector=RTMDet-l2026.01 | 76.1 | — | — | — | — | |
| Sapiens 0.3bDetection Approach=top-down, Detector=RTMDet-l2026.01 | 70.5 | — | — | — | — | |
| ViTPose-BDetection Approach=top-down, Detector=RTMDet-l2026.01 | 67.8 | — | — | — | — | |
| ViTPose-HBackbone=ViT-H, Resolution=256x1922022.12 | 67 | — | 78.5 | 70.2 | 80.7 | |
| ViTPose-LBackbone=ViT-L, Resolution=256x1922022.12 | 64.2 | — | 76 | 67.8 | 78.4 | |
| HRNetBackbone=HRNet-w48, Resolution=384x288, Ground truth bounding boxes=true2022.04 | 61.6 | — | 74.9 | 65.3 | 77.3 | |
| HRNetBackbone=HRNet-w48, Resolution=384x2882022.12 | 61.6 | — | 74.9 | 65.3 | 77.3 | |
| ProbPose-s-DHBounding Box=GT, Double Heatmap=true, Wider Field of View=true2024.12 | 61.4 | 61.2 | — | — | — | |
| HRNetBackbone=HRNet-w32, Resolution=384x288, Ground truth bounding boxes=true2022.04 | 60.6 | — | 74.8 | 64.7 | 77.6 | |
| HRNetBackbone=HRNet-w32, Resolution=384x2882022.12 | 60.6 | — | 74.8 | 64.7 | 77.6 | |
| ProbPose-sBounding Box=GT2024.12 | 60.4 | 60.2 | — | — | — | |
| HRFormer-sBounding Box=GT2024.12 | 60.3 | 60 | — | — | — | |
| ViTPose-sBounding Box=GT2024.12 | 60.3 | 60.1 | — | — | — | |
| ViTPose-BBackbone=ViT-B, Resolution=256x1922022.12 | 59.6 | — | 74.7 | 64.7 | 77.8 | |
| PVTv2Bounding Box=GT2024.12 | 58.5 | 58.1 | — | — | — | |
| SimpleBaselineBackbone=ResNet-152, Resolution=384x288, Ground truth bounding boxes=true2022.04 | 58.2 | — | 72.3 | 62.7 | 75.2 | |
| SimpleBaselineBackbone=ResNet-152, Resolution=384x2882022.12 | 58.2 | — | 72.3 | 62.7 | 75.2 | |
| SWIN-tBounding Box=GT2024.12 | 58.1 | 57.9 | — | — | — | |
| ViTPose-SBackbone=ViT-S, Resolution=256x1922022.12 | 57.4 | — | 74.7 | 61.8 | 77.4 | |
| BMPv2+ 2xDetection Approach=top-down, Detector=RTMDet-l, Iterative refinement=2x2026.01 | 55.8 | — | — | — | — | |
| HRFormerBackbone=HRFormer-S, Resolution=384x288, Ground truth bounding boxes=true2022.04 | 52.8 | — | 72.8 | 59.1 | 76.6 | |
| HRFormerBackbone=HRFormer-S, Resolution=384x2882022.12 | 52.8 | — | 72.8 | 59.1 | 76.6 | |
| BMPv2 2xDetection Approach=top-down, Detector=RTMDet-l, Iterative refinement=2x2026.01 | 51.5 | — | — | — | — | |
| HRFormerBackbone=HRFormer-B, Resolution=384x288, Ground truth bounding boxes=true2022.04 | 49.7 | — | 71.6 | 58.2 | 76 | |
| HRFormerBackbone=HRFormer-B, Resolution=384x2882022.12 | 49.7 | — | 71.6 | 58.2 | 76 | |
| BBox-Mask-Pose 2xMethod Category=Iterative, Iterations=2x, Detector=RTMDet-L2024.12 | 49.2 | — | — | — | — | |
| BMPv1 2xDetection Approach=top-down, Detector=RTMDet-l, Iterative refinement=2x2026.01 | 49.2 | — | — | — | — | |
| BUCTD 2xMethod Category=Iterative, Iterations=2x2024.12 | 48.3 | — | — | — | — | |
| BUCTD 2xDetection Approach=top-down, Detector=RTMDet-l, Iterative refinement=2x2026.01 | 48.3 | — | — | — | — | |
| PMPose-BDetection Approach=top-down, Detector=RTMDet-l2026.01 | 48.2 | — | — | — | — | |
| BUCTDMethod Category=Detection-free2024.12 | 47.4 | — | — | — | — | |
| BUCTDDetection Approach=bottom-up2026.01 | 47.4 | — | — | — | — | |
| BBox-Mask-Pose 1xMethod Category=Iterative, Iterations=1x, Detector=RTMDet-L2024.12 | 46.6 | — | — | — | — | |
| MaskPose-BDetection Approach=top-down, Detector=RTMDet-l2026.01 | 46.6 | — | — | — | — | |
| CID-w48Method Category=Detection-free2024.12 | 45 | — | — | — | — | |
| MaskPose-bMethod Category=Top-down, Detector=RTMDet-L2024.12 | 45 | — | — | — | — | |
| CID-w48Detection Approach=bottom-up2026.01 | 45 | — | — | — | — | |
| ViTPose*-BDetection Approach=top-down, Detector=RTMDet-l2026.01 | 44.1 | — | — | — | — | |
| ViTPose-BMethod Category=Top-down, Detector=RTMDet-L2024.12 | 42.6 | — | — | — | — | |
| MIPNetMethod Category=Top-down2024.12 | 42.5 | — | — | — | — | |
| MIPNetBackbone=HRNet-W48-384, Detector=Faster R-CNN, Paradigm=Top-Down2021.01 | 42.5 | — | — | — | — | |
| MIPNetDetection Approach=top-down, Detector=other2026.01 | 42.5 | — | — | — | — | |
| Sapiens 0.3bMethod Category=Top-down, Detector=RTMDet-L2024.12 | 41.3 | — | — | — | — | |
| Sapiens 0.3bDetection Approach=top-down, Detector=RTMDet-l2026.01 | 41.3 | — | — | — | — | |
| LOGO-CAPBackbone=HRNet-W48, Approach=Direct2021.09 | 40.4 | — | — | — | — | |
| HQNet R-50Method Category=Detection-free, Backbone=ResNet-502024.12 | 40 | — | — | — | — | |
| HQNet R-50Detection Approach=bottom-up2026.01 | 40 | — | — | — | — | |
| DEKRBackbone=HRNet-W48, Approach=Grouping2021.09 | 38.2 | — | — | — | — | |
| LOGO-CAPBackbone=HRNet-W32, Approach=Direct2021.09 | 38.1 | — | — | — | — | |
| ViTPose-BDetection Approach=top-down, Detector=RTMDet-l2026.01 | 37.5 | — | — | — | — | |
| HRNetBackbone=HRNet-W48-384, Detector=Faster R-CNN, Paradigm=Top-Down2021.01 | 37.2 | — | — | — | — | |
| DEKRMethod Category=Detection-free2024.12 | 36.5 | — | — | — | — | |
| DEKRBackbone=HRNet-W32, Approach=Grouping2021.09 | 36.5 | — | — | — | — | |
| DEKRDetection Approach=bottom-up2026.01 | 36.5 | — | — | — | — | |
| HGGBackbone=Hourglass, Multi-scale test=true, Single-person pose refinement=false2020.07 | 36 | — | — | — | — | |
| HGGParadigm=Bottom-Up, Multi-scale=x2, x1, x0.52021.01 | 36 | — | — | — | — | |
| MIPNetBackbone=ResNet101, Detector=YOLO-v3, Paradigm=Top-Down2021.01 | 35 | — | — | — | — | |
| HGGBackbone=Hourglass, Multi-scale test=false, Single-person pose refinement=false2020.07 | 34.8 | — | — | — | — | |
| HGGBackbone=Hourglass, Approach=Grouping2021.09 | 34.8 | — | — | — | — | |
| SBLBackbone=ResNet152, Multi-scale test=false, Single-person pose refinement=false2020.07 | 33.3 | — | — | — | — | |
| SBLBackbone=ResNet-152, Approach=Top-down2021.09 | 33.3 | — | — | — | — | |
| AEBackbone=Hourglass, Multi-scale test=true, Single-person pose refinement=false2020.07 | 32.8 | — | — | — | — | |
| AEParadigm=Bottom-Up, Multi-scale=x2, x1, x0.52021.01 | 32.8 | — | — | — | — | |
| HCQNetBackbone=Swin-B2023.03 | 30.9 | — | — | — | — | |
| RMPEBackbone=Hourglass, Multi-scale test=false, Single-person pose refinement=false2020.07 | 30.7 | — | — | — | — | |
| RMPEBackbone=Hourglass, Approach=Top-down2021.09 | 30.7 | — | — | — | — | |
| SBLBackbone=ResNet50, Multi-scale test=false, Single-person pose refinement=false2020.07 | 30.4 | — | — | — | — | |
| SBLBackbone=ResNet-50, Approach=Top-down2021.09 | 30.4 | — | — | — | — | |
| Pose2SegBackbone=R-502023.03 | 30.3 | — | — | — | — | |
| BaseNet-DPSBackbone=Swin-B2023.03 | 29.7 | — | — | — | — | |
| AEBackbone=Hourglass, Multi-scale test=false, Single-person pose refinement=false2020.07 | 29.5 | — | — | — | — | |
| AEBackbone=Hourglass, Approach=Grouping2021.09 | 29.5 | — | — | — | — | |
| OPEC-NetBackbone=ResNet101, Detector=YOLO-v3, Paradigm=Top-Down2021.01 | 29.1 | — | — | — | — | |
| AlphaPose+Backbone=ResNet101, Detector=YOLO-v3, Paradigm=Top-Down2021.01 | 27.5 | — | — | — | — | |
| SBLBackbone=ResNet101, Detector=YOLO-v3, Paradigm=Top-Down2021.01 | 24.1 | — | — | — | — | |
| MaskRCNNBackbone=ResNet101, Detector=YOLO-v3, Paradigm=Top-Down2021.01 | 20.2 | — | — | — | — |