Action Recognition on NTU RGB-D 60 (Cross-Subject)
97.4AccuracyPAN-Ensemble
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| PAN-Ensemble2D Skeleton=Yes, 3D Skeleton=Yes, RGB=Yes2025.12 | 97.4 | — | — | — | |
| PoseC3D2D Skeleton=Re-estimated data, 3D Skeleton=No, RGB=Yes2025.12 | 97 | — | — | — | |
| VPFN++ + 3D Poses + OFFusion=VPFN++ + 3D Poses + OF2021.05 | 96.7 | — | — | — | |
| VPFN++ + 3D Poses + OFFusion=VPFN++ + 3D Poses + OF2021.05 | 96.7 | — | — | — | |
| VPN++ + 3D PosesPose (modality)=true, RGB (modality)=true, Att (attention mechanism)=true, Architecture=RNX3D1012021.05 | 96.6 | — | — | — | |
| VPN++ (late fusion)2D Skeleton=No, 3D Skeleton=Yes, RGB=Yes2025.12 | 96.6 | — | — | — | |
| PGCNYear=2019, Pose Input=true, RGB Input=false2020.07 | 96.4 | — | — | — | |
| π-ViT (late fusion)2D Skeleton=Used in training only, 3D Skeleton=Yes, RGB=Yes2025.12 | 96.3 | — | — | — | |
| PAN-Unified2D Skeleton=Yes, 3D Skeleton=Yes, RGB=Yes2025.12 | 96.3 | — | — | — | |
| RNX3D101+MS-AAGCNPose (modality)=true, RGB (modality)=true, Att (attention mechanism)=false, Architecture=RNX3D1012021.05 | 96.1 | — | — | — | |
| PAN (Guided)2D Skeleton=Yes, 3D Skeleton=No, RGB=Yes2025.12 | 95.7 | — | — | — | |
| Inflated ResNet with Hierarchical ClassificationYear=2020, Pose Input=true, RGB Input=true2020.07 | 95.66 | — | — | — | |
| VPN (RNX3D101)Pose (modality)=true, RGB (modality)=true, Att (attention mechanism)=true, Architecture=RNX3D1012021.05 | 95.5 | — | — | — | |
| PAN (Even)2D Skeleton=No, 3D Skeleton=No, RGB=Yes2025.12 | 95.5 | — | — | — | |
| VPFN++ + 3D PosesFusion=VPFN++ + 3D Poses2021.05 | 95.1 | — | — | — | |
| VPFN++ + 3D PosesFusion=VPFN++ + 3D Poses2021.05 | 95.1 | — | — | — | |
| VPN++Stream=VPN++ + 3D Poses2021.05 | 94.9 | — | — | — | |
| VPN++ + 3D PosesPose (modality)=true, RGB (modality)=true, Att (attention mechanism)=true, Architecture=I3D2021.05 | 94.9 | — | — | — | |
| 3Mformer2D Skeleton=No, 3D Skeleton=Yes, RGB=No2025.12 | 94.8 | — | — | — | |
| PSUMNetParams. (M)=3.22022.08 | 94.7 | — | — | — | |
| VFN++ + OFStream=VFN++ + Optical Flow2021.05 | 94.6 | — | — | — | |
| Action MachineYear=2019, Pose Input=false, RGB Input=true2020.07 | 94.3 | — | — | — | |
| 3D-Def-Transformer2D Skeleton=Yes, 3D Skeleton=No, RGB=Yes2025.12 | 94.3 | — | — | — | |
| PoseC3DPose Source=2D pose estimations2022.10 | 94.1 | — | — | — | |
| DG-STGCNPose Source=2D pose estimations, Fusion=Ensemble (4 modalities)2022.10 | 94.1 | — | — | — | |
| PoseConv3DBackbone=PoseConv3D2025.05 | 94.1 | — | — | — | |
| π-ViT2D Skeleton=Used in training only, 3D Skeleton=Used in training only, RGB=Yes2025.12 | 94 | — | — | — | |
| CTR-GCNParams. (M)=5.62022.08 | 93.9 | — | — | — | |
| 2s DG-STGCNPose Source=2D pose estimations, Fusion=2-stream (joint+bone)2022.10 | 93.9 | — | — | — | |
| SKE2GRIDBackbone=SKE2GRID2025.05 | 93.8 | — | — | — | |
| ProtoGCN2D Skeleton=No, 3D Skeleton=Yes, RGB=No2025.12 | 93.8 | — | — | — | |
| FreqMixFormerFramework=Transformer, Stream Configuration=6-stream2024.07 | 93.6 | — | — | — | |
| VPNStream=Attention Fusion2021.05 | 93.5 | — | — | — | |
| VPNPose Quality=High2021.05 | 93.5 | — | — | — | |
| VPNPose (modality)=true, RGB (modality)=true, Att (attention mechanism)=true, Architecture=I3D2021.05 | 93.5 | — | — | — | |
| VPN++Pose (modality)=used only in training, RGB (modality)=true, Att (attention mechanism)=true, Architecture=RNX3D1012021.05 | 93.5 | — | — | — | |
| DSTA-NetParams. (M)=14.02022.08 | 93.5 | — | — | — | |
| VPN++2D Skeleton=No, 3D Skeleton=Used in training only, RGB=Yes2025.12 | 93.5 | — | — | — | |
| HD-GCNFramework=GCN, Stream Configuration=6-stream2024.07 | 93.4 | — | — | — | |
| FreqMixFormerFramework=Transformer, Stream Configuration=4-stream2024.07 | 93.4 | — | — | — | |
| Video Swin2D Skeleton=No, 3D Skeleton=No, RGB=Yes2025.12 | 93.4 | — | — | — | |
| DG-STGCNPose Source=3D Skeletons, Fusion=Ensemble (4 modalities)2022.10 | 93.2 | — | — | — | |
| ST-GCN++Pose Source=2D pose estimations2022.10 | 93.2 | — | — | — | |
| STEP-CATFormerFramework=Transformer2024.07 | 93.2 | — | — | — | |
| DG-STGCNBackbone=DG-STGCN2025.05 | 93.2 | — | — | — | |
| BlockGCNPublisher=CVPR20242025.01 | 93.1 | — | — | — | |
| LG-SGNetPublisher=PR20252025.01 | 93.1 | — | — | — | |
| BlockGCN2D Skeleton=No, 3D Skeleton=Yes, RGB=No2025.12 | 93.1 | — | — | — | |
| P-I3DPose (modality)=true, RGB (modality)=true, Att (attention mechanism)=true2021.05 | 93 | — | — | — | |
| WDCE-NetFramework=GCN2024.07 | 93 | — | — | — | |
| InfoGCNFramework=GCN, Stream Configuration=6-stream2024.07 | 93 | — | — | — | |
| HD-GCNFramework=GCN, Stream Configuration=4-stream2024.07 | 93 | — | — | — | |
| SkeMixFormerFramework=Transformer, Stream Configuration=6-stream2024.07 | 93 | — | — | — | |
| InfoGCN2D Skeleton=No, 3D Skeleton=Yes, RGB=No2025.12 | 93 | — | — | — | |
| TimeSformer2D Skeleton=No, 3D Skeleton=No, RGB=Yes2025.12 | 93 | — | — | — | |
| 2s DG-STGCNPose Source=3D Skeletons, Fusion=2-stream (joint+bone)2022.10 | 92.9 | — | — | — | |
| KoopmanFramework=GCN2024.07 | 92.9 | — | — | — | |
| Stream-GCNFramework=GCN2024.07 | 92.9 | — | — | — | |
| HyperformerFramework=Transformer2024.07 | 92.9 | — | — | — | |
| DG-STGCN(A0.66)Backbone=DG-STGCN, Sparsity level=0.66, Mode=Multi-level Assembly2025.05 | 92.9 | — | — | — | |
| FR-HeadFramework=GCN2024.07 | 92.8 | — | — | — | |
| TranSkeletonFramework=Transformer2024.07 | 92.8 | — | — | — | |
| SkeMixFormerFramework=Transformer, Stream Configuration=4-stream2024.07 | 92.8 | — | — | — | |
| DG-STGCN(S0.8)Backbone=DG-STGCN, Sparsity level=0.8, Mode=Sparse2025.05 | 92.8 | — | — | — | |
| DG-STGCN(S0.95)Backbone=DG-STGCN, Sparsity level=0.95, Mode=Sparse2025.05 | 92.8 | — | — | — | |
| DSTSA-GCNModality=Fusion2025.01 | 92.78 | — | — | — | |
| InfoGCNFramework=GCN, Stream Configuration=4-stream2024.07 | 92.7 | — | — | — | |
| DG-STGCN(S0.6)Backbone=DG-STGCN, Sparsity level=0.6, Mode=Sparse2025.05 | 92.7 | — | — | — | |
| ST-GCN++Pose Source=3D Skeletons2022.10 | 92.6 | — | — | — | |
| FG-STFormerFramework=Transformer2024.07 | 92.6 | — | — | — | |
| ST-GCN++Backbone=ST-GCN++2025.05 | 92.6 | — | — | — | |
| PST-Transformer MotionPDE2026.06 | 92.44 | — | — | — | |
| PSTNet++ MotionPDE2026.06 | 92.42 | — | — | — | |
| CTR-GCNPose Source=3D Skeletons2022.10 | 92.4 | — | — | — | |
| CTR-GCNFramework=GCN2024.07 | 92.4 | — | — | — | |
| CTR-GCNPublisher=ICCV20212025.01 | 92.4 | — | — | — | |
| CTR-GCNBackbone=CTR-GCN2025.05 | 92.4 | — | — | — | |
| CTR-GCN2D Skeleton=No, 3D Skeleton=Yes, RGB=No2025.12 | 92.4 | — | — | — | |
| SIT-MLPFramework=Transformer2024.07 | 92.3 | — | — | — | |
| KinetReference=CVPR 222026.06 | 92.3 | — | — | — | |
| Separable STAPose (modality)=true, RGB (modality)=true, Att (attention mechanism)=true2021.05 | 92.2 | — | — | — | |
| MS-G3D++Pose Source=2D pose estimations2022.10 | 92.2 | — | — | — | |
| VPFN++Fusion=VPFN++2021.05 | 92.1 | — | — | — | |
| VPFN++Fusion=VPFN++2021.05 | 92.1 | — | — | — | |
| SAN-GCNPublisher=TMM20232025.01 | 92.1 | — | — | — | |
| STAR-TransformerFramework=Transformer2024.07 | 92 | — | — | — | |
| STAR-Transformer2D Skeleton=Yes, 3D Skeleton=No, RGB=Yes2025.12 | 92 | — | — | — | |
| DualHead-NetStream configuration=four-stream fusion (4s)2021.08 | 92 | — | — | — | |
| MMTMYear=2019, Pose Input=false, RGB Input=true2020.07 | 91.99 | — | — | — | |
| VPN++Stream=Distilled2021.05 | 91.9 | — | — | — | |
| VPN++Pose Quality=High2021.05 | 91.9 | — | — | — | |
| VPN++Fusion=VPN++2021.05 | 91.9 | — | — | — | |
| VPN++Pose (modality)=used only in training, RGB (modality)=true, Att (attention mechanism)=true, Architecture=I3D2021.05 | 91.9 | — | — | — | |
| VPN++Fusion=VPN++2021.05 | 91.9 | — | — | — | |
| STSTFramework=Transformer2024.07 | 91.9 | — | — | — | |
| MS-G3DParams. (M)=6.42022.08 | 91.8 | — | — | — | |
| 4s-ShiftGCNParams. (M)=2.82022.08 | 91.8 | — | — | — | |
| PoseMapYear=2018, Pose Input=true, RGB Input=false2020.07 | 91.71 | — | — | — | |
| PEMPose (modality)=true, RGB (modality)=true, Att (attention mechanism)=false2021.05 | 91.7 | — | — | — | |
| EfficientGCN-B4Framework=GCN2024.07 | 91.7 | — | — | — |