Action Recognition on NTU 120 (Cross-Setup)
96.4AccuracyRGBPose-Conv3D
Evaluation Results
| Method | Links | |
|---|---|---|
| RGBPose-Conv3DModality=RGB + Pose, Fusion Strategy=early+late fusion, Backbone=ResNet-502021.04 | 96.4 | |
| PoseC3DModality (Pose)=Used at inference, Modality (RGB)=Used at inference2023.11 | 96.4 | |
| π-ViT + 3D PosesModality (Pose)=Used at inference, Modality (RGB)=Used at inference2023.11 | 96.1 | |
| Inflated ResNet with Hierarchical ClassificationYear=2020, Pose Input=true, RGB Input=true2020.07 | 94.54 | |
| 3MformerModality (Pose)=Used at inference, Modality (RGB)=Not used2023.11 | 93.8 | |
| E2E-GNetCategory=Deep Riemannian, Params (M)=0.93, FLOPs (G)=0.012026.03 | 93.3 | |
| π-ViTModality (Pose)=Used only in training, Modality (RGB)=Used at inference2023.11 | 92.9 | |
| STAR-TransformerModality (Pose)=Used at inference, Modality (RGB)=Used at inference2023.11 | 92.7 | |
| + 3D-SIMModality (Pose)=Used only in training, Modality (RGB)=Used at inference2023.11 | 92.7 | |
| VPN++ + 3D PosesPose=true, RGB=true, Attention mechanism=true2021.05 | 92.5 | |
| Method [12]Modality=RGB + Pose2021.04 | 92.5 | |
| VPN++ + 3D PosesModality (Pose)=Used at inference, Modality (RGB)=Used at inference2023.11 | 92.5 | |
| AutoregAd-HGformerCategory=HyperGraph Transformer, Venue=WACV 2025, Params (M)=3.20, FLOPs (G)=15.42026.03 | 92.4 | |
| ProtoGCNCategory=Graph Convolution, Venue=CVPR 20252026.03 | 92.2 | |
| ProtoGCNSupervision Type=Supervised, Publication=CVPR 20252026.04 | 92.2 | |
| Video SwinModality (Pose)=Not used, Modality (RGB)=Used at inference2023.11 | 92.1 | |
| DeGCNParams (M)=5.62026.03 | 92.1 | |
| FreqMixFormerCategory=Transformer/ Graph Transformer, Venue=ACM MM 2024, Params (M)=2.04, FLOPs (G)=2.402026.03 | 91.9 | |
| FreqMixFormerParams (M)=2.0, Flops (G)=64.42026.03 | 91.9 | |
| JT-GraphFormerCategory=Transformer/ Graph Transformer, Venue=AAAI 20242026.03 | 91.7 | |
| AdaptiveHGCNCategory=HyperGraph Convolution, Venue=ICCV 2025, Params (M)=1.10, FLOPs (G)=1.632026.03 | 91.7 | |
| JT-GraphFormerSupervision Type=Supervised, Publication=AAAI 20242026.04 | 91.7 | |
| NDMHICSupervision Type=Supervised, Publication=AAAI 20252026.04 | 91.7 | |
| TimeSformerModality (Pose)=Not used, Modality (RGB)=Used at inference2023.11 | 91.6 | |
| + 2D-SIMModality (Pose)=Used only in training, Modality (RGB)=Used at inference2023.11 | 91.6 | |
| HD-GCNCategory=Graph Convolution, Venue=ICCV 2023, Params (M)=1.68, FLOPs (G)=1.602026.03 | 91.6 | |
| HD-GCNSupervision Type=Supervised, Publication=ICCV 2023, FLOPs/G=7.082026.04 | 91.6 | |
| BlockGCNCategory=Graph Convolution, Venue=CVPR 2024, Params (M)=1.30, FLOPs (G)=1.632026.03 | 91.5 | |
| BlockGCNParams (M)=1.3, Flops (G)=1.62026.03 | 91.5 | |
| BlockGCNSupervision Type=Supervised, Publication=CVPR 2024, FLOPs/G=6.522026.04 | 91.5 | |
| VA-VRSupervision Type=Supervised, Publication=AAAI 20252026.04 | 91.5 | |
| 3D-Def-TransformerModality (Pose)=Used at inference, Modality (RGB)=Used at inference2023.11 | 91.4 | |
| DG-STGCN(A0.66)Backbone=DG-STGCN, Sparsity level=0.66, Mode=Multi-level Assembly2025.05 | 91.4 | |
| SkateFormerCategory=Transformer/ Graph Transformer, Venue=ECCV 2024, Params (M)=2.03, FLOPs (G)=3.622026.03 | 91.4 | |
| SkateFormerParams (M)=2.0, Flops (G)=3.62026.03 | 91.4 | |
| + UKTLarchitecture=Tensor-based, backbone=MLP + HoT2026.03 | 91.4 | |
| DG-STGCNBackbone=DG-STGCN2025.05 | 91.3 | |
| MAMSCategory=Transformer/ Graph Transformer, Venue=ICCV 20232026.03 | 91.3 | |
| HyperformerCategory=HyperGraph Transformer, Venue=ArXiv 2022, Params (M)=2.6, FLOPs (G)=14.82026.03 | 91.3 | |
| MAMPProtocol=Fine-tuned2026.03 | 91.3 | |
| HyperformerParams (M)=2.7, Flops (G)=9.62026.03 | 91.3 | |
| SkeMixFormerParams (M)=2.1, Flops (G)=4.82026.03 | 91.3 | |
| InfoGCNModality (Pose)=Used at inference, Modality (RGB)=Not used2023.11 | 91.2 | |
| InfoGCNCategory=Graph Convolution, Venue=CVPR 2022, Params (M)=1.60, FLOPs (G)=1.842026.03 | 91.2 | |
| SkeletonGCLCategory=Graph Convolution, Venue=ICLR 20232026.03 | 91.2 | |
| 3s-S2IEnsemble=3-stream, Protocol=Fine-tuned2026.03 | 91.2 | |
| SkeletonGCLSupervision Type=Supervised, Publication=ICLR 20232026.04 | 91.2 | |
| GAPCategory=Graph Convolution, Venue=ICCV 20232026.03 | 91.1 | |
| DS-GCNCategory=Graph Convolution, Venue=AAAI 20242026.03 | 91.1 | |
| GAPSupervision Type=Supervised, Publication=ICCV 20232026.04 | 91.1 | |
| DS-GCNSupervision Type=Supervised, Publication=AAAI 20242026.04 | 91.1 | |
| CTR-GCNarchitecture=Graph-based2026.03 | 91 | |
| FR HeadCategory=Graph Convolution, Venue=CVPR 2023, Params (M)=1.992026.03 | 90.9 | |
| FRHeadParams (M)=2.02026.03 | 90.9 | |
| FR-HeadSupervision Type=Supervised, Publication=CVPR 20232026.04 | 90.9 | |
| ST-GCN++Backbone=ST-GCN++2025.05 | 90.8 | |
| SKE2GRIDBackbone=SKE2GRID2025.05 | 90.8 | |
| DG-STGCN(S0.6)Backbone=DG-STGCN, Sparsity level=0.6, Mode=Sparse2025.05 | 90.8 | |
| PYSKLCategory=Graph Convolution, Venue=ACM MM 2022, Params (M)=1.39, FLOPs (G)=2.802026.03 | 90.8 | |
| KGS-GCNParams (M)=1.4, Flops (G)=1.32026.03 | 90.8 | |
| DG-STGCN(S0.8)Backbone=DG-STGCN, Sparsity level=0.8, Mode=Sparse2025.05 | 90.7 | |
| DST-HCNCategory=HyperGraph Convolution, Venue=ICME 2023, Params (M)=2.93, FLOPs (G)=3.502026.03 | 90.7 | |
| InfoGCNParams (M)=1.6, Flops (G)=1.82026.03 | 90.7 | |
| FD-GCNarchitecture=Graph-based2026.03 | 90.7 | |
| CTR-GCNBackbone=CTR-GCN2025.05 | 90.6 | |
| CTR-GCNCategory=Graph Convolution, Venue=ICCV 2021, Params (M)=1.46, FLOPs (G)=1.972026.03 | 90.6 | |
| FG-STFormerCategory=Transformer/ Graph Transformer, Venue=ACCV 20222026.03 | 90.6 | |
| DSDC-GCNarchitecture=Graph-based2026.03 | 90.6 | |
| TranSkeletonParams (M)=2.2, Flops (G)=9.22026.03 | 90.5 | |
| DG-STGCN(S0.95)Backbone=DG-STGCN, Sparsity level=0.95, Mode=Sparse2025.05 | 90.4 | |
| DG-STGCN(S0.99)Backbone=DG-STGCN, Sparsity level=0.99, Mode=Sparse2025.05 | 90.4 | |
| CTR-GCNParams (M)=1.5, Flops (G)=2.02026.03 | 90.4 | |
| PoseConv3DBackbone=PoseConv3D2025.05 | 90.3 | |
| + KTLarchitecture=Tensor-based, backbone=MLP + HoT2026.03 | 90.3 | |
| + KPCA (baseline)architecture=Tensor-based, backbone=MLP + HoT2026.03 | 90.1 | |
| + TPCA (baseline)architecture=Tensor-based, backbone=MLP + HoT2026.03 | 90 | |
| PoseC3DModality (Pose)=Used at inference, Modality (RGB)=Not used2023.11 | 89.6 | |
| VPN++Pose=false, RGB=true, Attention mechanism=true2021.05 | 89.3 | |
| VPN++Modality (Pose)=Used only in training, Modality (RGB)=Used at inference2023.11 | 89.3 | |
| EfficientGCNParams (M)=2.0, Flops (G)=15.22026.03 | 89.1 | |
| DSTA-NetBackbone=DSTA-Net2025.05 | 89 | |
| MST-GCNCategory=Graph Convolution, Venue=AAAI 2021, Params (M)=3.102026.03 | 88.8 | |
| Hyper-GCNarchitecture=Hypergraph-based2026.03 | 88.7 | |
| 4s-GSTNarchitecture=Transformer-based2026.03 | 88.7 | |
| MS-G3D NetYear=2020, Pose Input=true, RGB Input=false2020.07 | 88.4 | |
| MS-G3D NetPose=true, RGB=false, Attention mechanism=false2021.05 | 88.4 | |
| MS-G3DBones=true2020.08 | 88.4 | |
| MS-G3DBackbone=MS-G3D2025.05 | 88.4 | |
| MS-G3DCategory=Graph Convolution, Venue=CVPR 2020, Params (M)=3.17, FLOPs (G)=10.272026.03 | 88.4 | |
| MS-G3DParams (M)=2.8, Flops (G)=5.22026.03 | 88.4 | |
| MS-G3Darchitecture=Graph-based2026.03 | 88.4 | |
| SD-HGCNarchitecture=Hypergraph-based2026.03 | 88.2 | |
| DC-GCN+ADGCategory=HyperGraph Convolution, Venue=ECCV 2020, FLOPs (G)=16.202026.03 | 88.1 | |
| HyperformerModality (Pose)=Used at inference, Modality (RGB)=Not used2023.11 | 88 | |
| MotionFormerModality (Pose)=Not used, Modality (RGB)=Used at inference2023.11 | 87.9 | |
| S2IProtocol=Fine-tuned2026.03 | 87.9 | |
| DHGCNarchitecture=Hypergraph-based2026.03 | 87.9 | |
| VPNPose=true, RGB=true, Attention mechanism=true2021.05 | 87.8 | |
| VPNModality (Pose)=Used at inference, Modality (RGB)=Used at inference2023.11 | 87.8 | |
| 4s Shift-GCNBones=true2020.08 | 87.6 |