3D Human Pose and Shape Estimation on 3DPW (test)
40.6MPJPE-PATAR
Evaluation Results
| Method | Links | ||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| TARNumber of input frames=9, Backbone=HRNet2023.11 | 40.6 | 62.7 | — | 74.4 | — | — | — | — | — | — | 7.7 | — | — | — | — | — | — | — | |
| INT-2Input Mode=Video-based, Backbone=ResNet-50, Supervision=w/ 3DPW training dataset, Phases=Three phases2023.03 | 42 | 75.6 | — | 87.9 | — | — | — | — | — | — | 16.5 | — | — | — | — | — | — | — | |
| INTNumber of input frames=642023.11 | 42 | 75.6 | — | 87.9 | — | — | — | — | — | — | 16.5 | — | — | — | — | — | — | — | |
| HybrIK-TransformerBackbone=HrNet-48, Training Data=w. 3DPW2023.02 | 42.3 | 71.6 | — | 83.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HybrIK-TransformerBackbone=HrNet-482023.02 | 43.4 | 73.6 | — | 87.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HybrIK (Adaptive)variant=Adaptive, trained with 3DPW=true2020.11 | 45 | 74.1 | — | 86.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HybrIKTraining Data=w. 3DPW2023.02 | 45 | 74.1 | — | 86.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TARNumber of input frames=9, Backbone=ResNet502023.11 | 45.3 | 68.4 | — | 83.9 | — | — | — | — | — | — | 7.9 | — | — | — | — | — | — | — | |
| Mesh Graphormertrained with 3DPW=true2020.11 | 45.6 | 74.7 | — | 87.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mesh GraphormerInput Mode=Image-based, Backbone=HRNet-W64, Supervision=w/ 3DPW training dataset2023.03 | 45.6 | 74.7 | — | 87.7 | — | — | — | — | — | — | 34.5 | — | — | — | — | — | — | — | |
| Mesh GraphormerTraining Data=w. 3DPW2023.02 | 45.6 | 74.7 | — | 87.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAEDInput Mode=Video-based, Backbone=ResNet-50, Supervision=w/ 3DPW training dataset2023.03 | 45.7 | 79.1 | — | 92.6 | — | — | — | — | — | — | 17.6 | — | — | — | — | — | — | — | |
| MAEDNumber of input frames=642023.11 | 45.7 | 79.1 | — | 92.6 | — | — | — | — | — | — | 17.6 | — | — | — | — | — | — | — | |
| MAEDInput=video, Training Data=w/ 3DPW2021.09 | 45.7 | 79.1 | — | 92.6 | — | — | — | — | — | — | 17.6 | — | — | — | — | — | — | — | |
| HybrIK-TransformerBackbone=ResNet-34, Training Data=w. 3DPW2023.02 | 46 | 74.9 | — | 88.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TARModality=video-based, Trained on 3DPW=false2023.11 | 46.3 | 71 | 84.7 | — | — | — | — | — | — | — | 7.4 | — | — | — | — | — | — | — | |
| PAREtrained with 3DPW=true2020.11 | 46.4 | 74.7 | — | 87.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PARETraining Data=w. 3DPW2023.02 | 46.4 | 74.7 | — | 87.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PARECategory=single-stage, Backbone=HRNet-W32, with-3DPW-training=true2021.04 | 46.5 | 74.5 | — | 88.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PAREInput Mode=Image-based, Backbone=HRNet-W32, Supervision=w/ 3DPW training dataset2023.03 | 46.5 | 74.5 | — | 88.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PyMAFModality=image-based, Trained on 3DPW=false2023.11 | 47.1 | 78 | 91.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ROMPInput Mode=Image-based, Backbone=HRNet-W32, Supervision=w/ 3DPW training dataset2023.03 | 47.3 | 76.7 | — | 93.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HybrIK-TransformerBackbone=ResNet-342023.02 | 47.6 | 75.7 | — | 91.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| METROapproach=image-based2020.12 | 47.9 | 77.1 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| METROInput Mode=Image-based, Backbone=HRNet-W64, Supervision=w/ 3DPW training dataset2023.03 | 47.9 | 77.1 | — | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HybrIK (Adaptive)variant=Adaptive2020.11 | 48.8 | 80 | — | 94.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HybrikInput Mode=Image-based, Backbone=ResNet-34, Supervision=w/o 3DPW training dataset2023.03 | 48.8 | 80 | — | 94.5 | — | — | — | — | — | — | 34.5 | — | — | — | — | — | — | — | |
| HybrIK2023.02 | 48.8 | 80 | — | 94.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HybrIKModality=image-based, Trained on 3DPW=false2023.11 | 48.8 | 80 | 94.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HybrIK (Naive)variant=Naive2020.11 | 49 | 80.2 | — | 94.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ROMPInput Mode=Image-based, Backbone=ResNet-50, Supervision=w/ 3DPW training dataset2023.03 | 49.7 | 79.7 | — | 94.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| INT-1Input Mode=Video-based, Backbone=ResNet-50, Supervision=w/o 3DPW training dataset, Phases=First two phases2023.03 | 49.7 | 90 | — | 105.1 | — | — | — | — | — | — | 23.5 | — | — | — | — | — | — | — | |
| INTModality=video-based, Trained on 3DPW=false2023.11 | 49.7 | 90 | 105.1 | — | — | — | — | — | — | — | 23.5 | — | — | — | — | — | — | — | |
| GLoTNumber of input frames=162023.11 | 50.6 | 80.7 | — | 96.3 | — | — | — | — | — | — | 6.6 | — | — | — | — | — | — | — | |
| MAEDInput=video, Training Data=w/o 3DPW2021.09 | 50.7 | 88.8 | — | 104.5 | — | — | — | — | — | — | 18 | — | — | — | — | — | — | — | |
| PARECategory=single-stage, Backbone=HRNet-W322021.04 | 50.9 | 82 | — | 97.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PAREInput Mode=Image-based, Backbone=HRNet-W32, Supervision=w/o 3DPW training dataset2023.03 | 50.9 | 82 | — | 97.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PAREModality=image-based, Trained on 3DPW=false2023.11 | 50.9 | 82 | 97.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| THUNDRShape evaluation=GHUM2021.06 | 51.5 | 74.8 | 88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DSRTraining data=w/ 3DPW train2021.10 | 51.7 | 85.7 | — | 99.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VIBEapproach=video-based2020.12 | 51.9 | 82 | 99.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VIBEInput Mode=Video-based, Backbone=ResNet (from SPIN), Supervision=w/ 3DPW training dataset2023.03 | 51.9 | 82.9 | — | 99.1 | — | — | — | — | — | — | 23.4 | — | — | — | — | — | — | — | |
| VIBEInput=video, Training Data=w/ 3DPW2021.09 | 51.9 | 82.9 | — | 99.1 | — | — | — | — | — | — | 23.4 | — | — | — | — | — | — | — | |
| MPS-NetInput Mode=Video-based, Backbone=ResNet (from SPIN), Supervision=w/ 3DPW training dataset2023.03 | 52.1 | 84.3 | — | 99.7 | — | — | — | — | — | — | 7.4 | — | — | — | — | — | — | — | |
| MPS-NetNumber of input frames=162023.11 | 52.1 | 84.3 | — | 99.7 | — | — | — | — | — | — | 7.4 | — | — | — | — | — | — | — | |
| EFTTraining data=w/ 3DPW train2021.10 | 52.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PARECategory=single-stage, Backbone=ResNet-502021.04 | 52.3 | 82.9 | — | 99.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TePoseReal-time capability=true, Training dataset=3DPW train set, Number of input frames (T+1)=62022.07 | 52.3 | 84.6 | 100.3 | — | — | 11.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| PAREInput Mode=Image-based, Backbone=ResNet-50, Supervision=w/o 3DPW training dataset2023.03 | 52.3 | 82.9 | — | 99.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TCMRReal-time capability=false, Training dataset=3DPW train set, Number of input frames (T+1)=162022.07 | 52.7 | 86.5 | 102.9 | — | — | 7.1 | — | — | — | — | — | — | — | — | — | — | — | — | |
| TCMRNumber of input frames=162023.11 | 52.7 | 86.5 | — | 102.9 | — | — | — | — | — | — | 7.1 | — | — | — | — | — | — | — | |
| SPEC2021.10 | 53.2 | — | — | — | — | — | 106.4 | 106.4 | 127.4 | 127.4 | — | — | — | — | — | — | — | — | |
| GLoTInput type=video2023.03 | 53.5 | 89.9 | 107.8 | — | — | — | — | — | — | — | 6.7 | — | — | — | — | — | — | — | |
| GLOTModality=video-based, Trained on 3DPW=false2023.11 | 53.5 | 89.9 | 107.8 | — | — | — | — | — | — | — | 6.7 | — | — | — | — | — | — | — | |
| HMRvariant=HMR*, training_data=Same datasets as SPEC (COCO, SPEC-SYN, MPI-INF-3DHP, Human3.6M), type=IWP-cam baseline2021.10 | 53.7 | — | — | — | — | — | 119.2 | 104 | 136.2 | 120.6 | — | — | — | — | — | — | — | — | |
| MPS-NetInput type=video2023.03 | 54 | 91.6 | 109.6 | — | — | — | — | — | — | — | 7.5 | — | — | — | — | — | — | — | |
| MPS-NetModality=video-based, Trained on 3DPW=false2023.11 | 54 | 91.6 | 109.6 | — | — | — | — | — | — | — | 7.5 | — | — | — | — | — | — | — | |
| DSRTraining data=standard2021.10 | 54.1 | 91.7 | — | 105.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HMR-EFTCategory=single-stage2021.04 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EFTTraining data=standard2021.10 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pose2PoseModality=image-based, Trained on 3DPW=false2023.11 | 54.4 | 86.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MEVACategory=temporal2021.04 | 54.7 | 86.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MEVAReal-time capability=false, Training dataset=3DPW train set, Number of input frames (T+1)=902022.07 | 54.7 | 86.9 | — | — | — | 11.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| MEVANumber of input frames=902023.11 | 54.7 | 86.9 | — | — | — | — | — | — | — | — | 11.6 | — | — | — | — | — | — | — | |
| MEVAInput=video, Training Data=w/ 3DPW2021.09 | 54.7 | 86.9 | — | — | — | — | — | — | — | — | 11.6 | — | — | — | — | — | — | — | |
| TCMRInput Mode=Video-based, Backbone=ResNet (from SPIN), Supervision=w/o 3DPW training dataset2023.03 | 55.8 | 95 | — | 111.3 | — | — | — | — | — | — | 6.7 | — | — | — | — | — | — | — | |
| TCMRInput type=video2023.03 | 55.8 | 95 | 111.5 | — | — | — | — | — | — | — | 7 | — | — | — | — | — | — | — | |
| LearnedGDCategory=multi-stage2021.04 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HUND2021.06 | 56.5 | 87.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VIBECategory=temporal2021.04 | 56.5 | 93.5 | — | 113.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VIBEInput type=video2023.03 | 56.5 | 93.5 | 113.4 | — | — | — | — | — | — | — | 27.1 | — | — | — | — | — | — | — | |
| VIBEModality=video-based, Trained on 3DPW=false2023.11 | 56.5 | 93.5 | 113.4 | — | — | — | — | — | — | — | 27.1 | — | — | — | — | — | — | — | |
| TCMRModality=video-based, Trained on 3DPW=false2023.11 | 56.5 | 95 | 111.5 | — | — | — | — | — | — | — | 7 | — | — | — | — | — | — | — | |
| VIBEInput=video, Training Data=w/o 3DPW2021.09 | 56.5 | 93.5 | — | 113.4 | — | — | — | — | — | — | 27.1 | — | — | — | — | — | — | — | |
| Zanfir et al.Category=multi-stage2021.04 | 57.1 | 90 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Zanfir et al.Training data=w/ 3DPW train2021.10 | 57.1 | 90 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HUNDtraining_protocol=FS+SS2020.08 | 57.5 | 81.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VIBEReal-time capability=true, Training dataset=3DPW train set, Number of input frames (T+1)=162022.07 | 57.6 | 91.9 | — | — | — | 25.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| VIBENumber of input frames=162023.11 | 57.6 | 91.9 | — | 99.1 | — | — | — | — | — | — | 25.4 | — | — | — | — | — | — | — | |
| I2L-MeshNet2021.06 | 57.7 | 93.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| I2LMeshNet2020.12 | 57.7 | 93.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| I2L-MeshNet+Input Mode=Image-based, Backbone=ResNet-50, Supervision=w/o 3DPW training dataset2023.03 | 57.7 | 93.2 | — | 110.1 | — | — | — | — | — | — | 30.9 | — | — | — | — | — | — | — | |
| I2L-MeshNetInput type=single image2023.03 | 57.7 | 93.2 | 110.1 | — | — | — | — | — | — | — | 30.9 | — | — | — | — | — | — | — | |
| I2LMeshNetInput=image, Training Data=w/o 3DPW2021.09 | 57.7 | 93.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pose2MeshModality=image-based, Trained on 3DPW=false2023.11 | 58.3 | 88.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pose2MeshInput=2D Pose, Training Data=w/o 3DPW2021.09 | 58.3 | 88.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| I2L-MeshNetCategory=multi-stage2021.04 | 58.6 | 93.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| I2Ltrained on different datasets=true2020.11 | 58.6 | 93.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| I2L2023.02 | 58.6 | 93.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pose2Mesh2021.06 | 58.9 | 89.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pose2Mesh2020.12 | 58.9 | 89.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pose2MeshCategory=multi-stage2021.04 | 58.9 | 89.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PyMAF+Input Mode=Image-based, Backbone=ResNet-50, Supervision=w/o 3DPW training dataset2023.03 | 58.9 | 92.8 | — | 110.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PyMAFInput type=single image2023.03 | 58.9 | 92.8 | 110.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPIN2021.10 | 59 | — | — | — | — | — | 122.2 | 116.6 | 140.9 | 135.8 | — | — | — | — | — | — | — | — | |
| SPIN2021.06 | 59.2 | — | 116.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPIN2020.12 | 59.2 | — | 116.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPINtraining_protocol=FS+WS2020.08 | 59.2 | 96.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPINCategory=single-stage2021.04 | 59.2 | 96.9 | — | 135.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPINBody model=SMPL2021.05 | 59.2 | — | 53 | — | 96.9 | — | — | — | — | — | — | — | — | — | — | — | — | — |