Action Recognition on NTU RGB+D 60 (cross-view)
99.6AccuracyRGBPose-Conv3D
Evaluation Results
| Method | Links | |
|---|---|---|
| RGBPose-Conv3DModality=RGB + Pose, Fusion Strategy=early+late fusion, Backbone=ResNet-502021.04 | 99.6 | |
| PoseC3DPre-training=true, Feature: RGB=true, Feature: Est. Pose=true, Feature: Annot. Pose=false2022.10 | 99.6 | |
| PoseC3DModality (Pose)=Yes, Modality (RGB)=Yes2023.11 | 99.6 | |
| VPFN++ + 3D Poses + OFFusion=VPFN++ + 3D Poses + OF2021.05 | 99.1 | |
| VPN++ + 3D PosesPose (modality)=true, RGB (modality)=true, Att (attention mechanism)=true, Architecture=RNX3D1012021.05 | 99.1 | |
| VPFN++ + 3D Poses + OFFusion=VPFN++ + 3D Poses + OF2021.05 | 99.1 | |
| VPN++ + 3D PosesModality (Pose)=Yes, Modality (RGB)=Yes2023.11 | 99.1 | |
| RNX3D101+MS-AAGCNPose (modality)=true, RGB (modality)=true, Att (attention mechanism)=false, Architecture=RNX3D1012021.05 | 99 | |
| π-ViT + 3D PosesModality (Pose)=Yes, Modality (RGB)=Yes2023.11 | 99 | |
| Method [14]Modality=RGB + Pose2021.04 | 98.9 | |
| ViewConModality (Pose)=Yes, Modality (RGB)=Yes2023.11 | 98.9 | |
| Inflated ResNet with Hierarchical ClassificationYear=2020, Pose Input=true, RGB Input=true2020.07 | 98.79 | |
| 3MformerModality (Pose)=Yes, Modality (RGB)=No2023.11 | 98.7 | |
| DG-STGCNPose Source=2D pose estimations, Fusion=Ensemble (4 modalities)2022.10 | 98.6 | |
| SKE2GRIDBackbone=SKE2GRID2025.05 | 98.6 | |
| ST-GCN++Pose Source=2D pose estimations2022.10 | 98.5 | |
| 2s DG-STGCNPose Source=2D pose estimations, Fusion=2-stream (joint+bone)2022.10 | 98.5 | |
| KAN-HyperpointNetReference=ICASSP 252026.06 | 98.4 | |
| X3D-UGTGFLOPs=9.15, Params (M)=0.96, Modality=RGB-only2026.02 | 98.31 | |
| VPFN++ + 3D PosesFusion=VPFN++ + 3D Poses2021.05 | 98.2 | |
| VPFN++ + 3D PosesFusion=VPFN++ + 3D Poses2021.05 | 98.2 | |
| DVANetGFLOPs=25.5, Params (M)=40.5, Modality=RGB-only2026.02 | 98.2 | |
| VPN++Stream=VPN++ + 3D Poses2021.05 | 98.1 | |
| VPN++ + 3D PosesPose (modality)=true, RGB (modality)=true, Att (attention mechanism)=true, Architecture=I3D2021.05 | 98.1 | |
| VPN++ + 3D PosesStream=VPN++ + 3D Poses2021.05 | 98.1 | |
| VPN (RNX3D101)Pose (modality)=true, RGB (modality)=true, Att (attention mechanism)=true, Architecture=RNX3D1012021.05 | 98 | |
| VPNPre-training=false, Feature: RGB=true, Feature: Est. Pose=false, Feature: Annot. Pose=true2022.10 | 98 | |
| VPNModality (Pose)=Yes, Modality (RGB)=Yes2023.11 | 98 | |
| ViewConModality (Pose)=No, Modality (RGB)=Yes2023.11 | 98 | |
| Shah et al. (2023)Modality=RGB-only2026.02 | 98 | |
| 3D-Def-TransformerModality (Pose)=Yes, Modality (RGB)=Yes2023.11 | 97.9 | |
| π-ViTModality (Pose)=Training only, Modality (RGB)=Yes2023.11 | 97.9 | |
| TimeSformer + 3D-SIMModality (Pose)=Training only, Modality (RGB)=Yes2023.11 | 97.8 | |
| EPP-NetModality=Skeleton+Parsing2024.01 | 97.7 | |
| Zhu et al. (2019)GFLOPs=51.7, Params (M)=33.0, Modality=RGB-only2026.02 | 97.7 | |
| ACLNetPublication=This Paper2026.01 | 97.7 | |
| EPP-Net (J+B+P)Modality=Skeleton+Parsing2024.01 | 97.6 | |
| HiODBackbone=GCN, Evaluation Protocol=FT.2026.02 | 97.6 | |
| SequentialPointNetReference=IEEE TII 222026.06 | 97.6 | |
| DG-STGCNPose Source=3D Skeletons, Fusion=Ensemble (4 modalities)2022.10 | 97.5 | |
| DG-STGCNBackbone=DG-STGCN2025.05 | 97.5 | |
| DS-GCNPublication=AAAI 20242026.01 | 97.5 | |
| ST-GCN++Pose Source=3D Skeletons2022.10 | 97.4 | |
| TSMFModality=Skeleton+RGB, Source=AAAI'212024.01 | 97.4 | |
| FreqMixFormerFramework=Transformer, Stream Configuration=6-stream2024.07 | 97.4 | |
| ST-GCN++Backbone=ST-GCN++2025.05 | 97.4 | |
| DG-STGCN(A0.66)Backbone=DG-STGCN, Sparsity level=0.66, Mode=Multi-level Assembly2025.05 | 97.4 | |
| 2s DG-STGCNPose Source=3D Skeletons, Fusion=2-stream (joint+bone)2022.10 | 97.3 | |
| STEP-CATFormerFramework=Transformer2024.07 | 97.3 | |
| FreqMixFormerFramework=Transformer, Stream Configuration=4-stream2024.07 | 97.3 | |
| DG-STGCN(S0.6)Backbone=DG-STGCN, Sparsity level=0.6, Mode=Sparse2025.05 | 97.3 | |
| DG-STGCN(S0.8)Backbone=DG-STGCN, Sparsity level=0.8, Mode=Sparse2025.05 | 97.3 | |
| HyperPointNetReference=ICME 222026.06 | 97.3 | |
| PST-Transformer MotionPDE2026.06 | 97.24 | |
| Action MachineYear=2019, Pose Input=false, RGB Input=true2020.07 | 97.2 | |
| VFN++ + OFStream=VFN++ + Optical Flow2021.05 | 97.2 | |
| TimeSformerModality (Pose)=No, Modality (RGB)=Yes2023.11 | 97.2 | |
| LA-GCNModality=Skeleton+Text, Source=arXiv'232024.01 | 97.2 | |
| WDCE-NetFramework=GCN2024.07 | 97.2 | |
| HD-GCNFramework=GCN, Stream Configuration=6-stream2024.07 | 97.2 | |
| HD-GCNPublication=ICCV 20232026.01 | 97.2 | |
| VA-ARPublication=AAAI 20252026.01 | 97.2 | |
| PoseConv3D (J+L)Input Modality=joint/limb, Skeleton Source=high-quality 2D skeletons (Sec 3.1)2021.04 | 97.1 | |
| DDGCNType=GCN based2022.08 | 97.1 | |
| DDGCN2022.05 | 97.1 | |
| PoseC3DPose Source=2D pose estimations2022.10 | 97.1 | |
| InfoGCNPre-training=false, Feature: RGB=false, Feature: Est. Pose=false, Feature: Annot. Pose=true2022.10 | 97.1 | |
| InfoGCNModality (Pose)=Yes, Modality (RGB)=No2023.11 | 97.1 | |
| InfoGCNModality=Skeleton, Source=CVPR 222024.01 | 97.1 | |
| Info-GCNYear=CVPR’22, Number of streams=62024.07 | 97.1 | |
| STC-NetYear=ICCV’23, Number of streams=42024.07 | 97.1 | |
| Shap-MixYear=-, Number of streams=42024.07 | 97.1 | |
| InfoGCNFramework=GCN, Stream Configuration=6-stream2024.07 | 97.1 | |
| SkeMixFormerFramework=Transformer, Stream Configuration=6-stream2024.07 | 97.1 | |
| PoseConv3DBackbone=PoseConv3D2025.05 | 97.1 | |
| DG-STGCN(S0.95)Backbone=DG-STGCN, Sparsity level=0.95, Mode=Sparse2025.05 | 97.1 | |
| InfoGCNPublication=CVPR 20222026.01 | 97.1 | |
| SkeletonGCLPublication=ICLR 20232026.01 | 97.1 | |
| DSTSA-GCNModality=Fusion2025.01 | 97.03 | |
| PSTNet++ MotionPDE2026.06 | 97.01 | |
| TCA-GCNfusion=four-stream2022.05 | 97 | |
| TimeSformer + 2D-SIMModality (Pose)=Training only, Modality (RGB)=Yes2023.11 | 97 | |
| LSTModality=Skeleton+Text, Source=ICCV'232024.01 | 97 | |
| HD-GCNYear=ICCV’23, Number of streams=42024.07 | 97 | |
| HD-GCNFramework=GCN, Stream Configuration=4-stream2024.07 | 97 | |
| TranSkeletonFramework=Transformer2024.07 | 97 | |
| BlockGCNPublisher=CVPR20242025.01 | 97 | |
| BlockGCNBackbone=GCN, Evaluation Protocol=FT.2026.02 | 97 | |
| BlockGCNPublication=CVPR 20242026.01 | 97 | |
| TCA-GCNfusion=standard2022.05 | 96.9 | |
| InfoGCNType=Hybrid Model, Parameters(M)=1.6M, Modality=4 streams, MMD losses=true2022.11 | 96.9 | |
| Info-GCNYear=CVPR’22, Number of streams=42024.07 | 96.9 | |
| StreamGCNYear=IJCAI’23, Number of streams=62024.07 | 96.9 | |
| Stream-GCNFramework=GCN2024.07 | 96.9 | |
| InfoGCNFramework=GCN, Stream Configuration=4-stream2024.07 | 96.9 | |
| SkeMixFormerFramework=Transformer, Stream Configuration=4-stream2024.07 | 96.9 | |
| CTR-GCNType=GCN based, Params. (M)=5.6, FLOPs (G)=7.62022.08 | 96.8 | |
| CTR-GCN2022.05 | 96.8 | |
| CTR-GCNPose Source=3D Skeletons2022.10 | 96.8 | |
| CTR-GCNPre-training=false, Feature: RGB=false, Feature: Est. Pose=false, Feature: Annot. Pose=true2022.10 | 96.8 |