Action Recognition on Diving-48 (test)
92.7Top-1 AccMOSS-L
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MOSS-LBackbone=L2026.04 | 92.7 | — | |
| Frame2Freq-MSBackbone=ViT-B/16, Pretrain=CLIP, Param (M)=7.3, Fine-tuning Framework Type=Parameter Efficient Fine-tuning Frameworks2026.02 | 92.2 | — | |
| ZeroI2VPretrain=CLIP, Backbone=ViT-L/14, Evaluation Protocol=PETL, Temporal clips=12023.10 | 91.4 | — | |
| MOSS-BBackbone=B2026.04 | 91.2 | — | |
| Video-FocalNet-BBackbone=B2026.04 | 90.8 | — | |
| AIM ViT-L/14Pretrain=CLIP, Tunable Param (M)=382023.02 | 90.6 | — | |
| AIMPretrain=CLIP, Backbone=ViT-L/14, Evaluation Protocol=PETL, Temporal clips=12023.10 | 90.6 | — | |
| AIM ViT-LBackbone=ViT-L2026.04 | 90.6 | — | |
| ST-AdapterBackbone=ViT-B/16, Pretrain=CLIP, Param (M)=7, Fine-tuning Framework Type=Parameter Efficient Fine-tuning Frameworks2026.02 | 90.4 | — | |
| V-JEPA 22026.04 | 89.8 | — | |
| ZeroI2VPretrain=CLIP, Backbone=ViT-B/16, Evaluation Protocol=PETL, Temporal clips=12023.10 | 89.7 | — | |
| AIM ViT-B/16Pretrain=CLIP, Tunable Param (M)=112023.02 | 88.9 | — | |
| AIMPretrain=CLIP, Backbone=ViT-B/16, Evaluation Protocol=PETL, Temporal clips=12023.10 | 88.9 | — | |
| AIMBackbone=ViT-B/16, Pretrain=CLIP, Param (M)=11, Fine-tuning Framework Type=Parameter Efficient Fine-tuning Frameworks2026.02 | 88.9 | — | |
| DUALPATHArch=ViT-B/16, Pretrain=CLIP, Params=10M2023.03 | 88.7 | — | |
| DualPathBackbone=ViT-B/16, Pretrain=CLIP, Param (M)=10, Fine-tuning Framework Type=Parameter Efficient Fine-tuning Frameworks2026.02 | 88.7 | — | |
| Side4Video-B*Backbone=B, reproduced by our setup=true2026.04 | 88.6 | — | |
| StructViT-B-4-1Backbone=B-4-12026.04 | 88.3 | — | |
| ORViT TimeSformerPre-train=IN, Frames=322021.10 | 88 | — | |
| ORVITPretrain=IN-21K, Tunable Param (M)=1602023.02 | 88 | — | |
| ORVITPretrain=IN-21K, Params=160M2023.03 | 88 | — | |
| ORViTBackbone=ViT-B/16, Pretrain=IN-21K, Param (M)=160, Fine-tuning Framework Type=Fully fine-tuned Frameworks2026.02 | 88 | — | |
| ORViT2026.04 | 88 | — | |
| V-JEPA2026.04 | 87.9 | — | |
| SIFAR-B-14Pretrain=IN-21K, Tunable Param (M)=872023.02 | 87.3 | — | |
| SIFAR-B-14Pretrain=IN-21K, Params=87M2023.03 | 87.3 | — | |
| SIFARBackbone=ViT-B/14, Pretrain=IN-21K, Param (M)=87, Fine-tuning Framework Type=Fully fine-tuned Frameworks2026.02 | 87.3 | — | |
| DVTAttention=D-ST+MS-A, ViT Architecture=MVIT-B, Pretraining=IN-1K, Clip Size=32 x 224^22022.03 | 86.9 | — | |
| BEVTPretrain=K400†, Tunable Param (M)=882023.02 | 86.7 | — | |
| BEVTBackbone=ViT-B/16, Pretrain=K400, Param (M)=88, Fine-tuning Framework Type=Fully fine-tuned Frameworks2026.02 | 86.7 | — | |
| DVTAttention=D-ST+MS-A, ViT Architecture=ViT-B, Pretraining=IN-1K, Clip Size=16 x 448^22022.03 | 86.6 | — | |
| DVTAttention=D-ST+MS-A, ViT Architecture=MVIT-B, Pretraining=IN-1K, Clip Size=16 x 224^22022.03 | 86 | — | |
| RSANet-R50FLOPs x clips=72 G x 22021.11 | 84.2 | — | |
| DVTAttention=D-ST+MS-A, ViT Architecture=ViT-B, Pretraining=IN-1K, Clip Size=16 x 224^22022.03 | 83.5 | — | |
| TimeSformer + STRG + STINPre-train=IN, Frames=322021.10 | 83.5 | — | |
| VideoSwin-BPretrain=IN-21K, Tunable Param (M)=882023.02 | 81.9 | — | |
| VideoSwin-BPretrain=IN-21K, Params=88M2023.03 | 81.9 | — | |
| VideoSwin-BPretrain=IN21K, Evaluation Protocol=full fine-tuning2023.10 | 81.9 | — | |
| VideoSwinBackbone=ViT-B/16, Pretrain=IN-21K, Param (M)=88, Fine-tuning Framework Type=Fully fine-tuned Frameworks2026.02 | 81.9 | — | |
| TQNPre-train=K400, Frames=ALL2021.10 | 81.8 | — | |
| TimeSformer-LFLOPs x clips=2380 G x 32021.11 | 81 | — | |
| TformerAttention=Divided-ST, ViT Architecture=ViT-B, Pretraining=IN-1K, Clip Size=96 x 224^22022.03 | 81 | — | |
| TimeSformer-LPre-train=IN, Frames=962021.10 | 81 | — | |
| TimeSformer + STINPre-train=IN, Frames=322021.10 | 81 | — | |
| TimeSformer-LPretrain=IN-21K, Tunable Param (M)=1212023.02 | 81 | — | |
| TimeSformer-LPretrain=IN-21K, Params=121M2023.03 | 81 | — | |
| TimeSformer-LPretrain=IN21K, Evaluation Protocol=full fine-tuning2023.10 | 81 | — | |
| TimeSformerBackbone=ViT-L/14, Pretrain=IN-21K, Param (M)=121, Fine-tuning Framework Type=Fully fine-tuned Frameworks2026.02 | 81 | — | |
| TimeSformer-L2026.04 | 81 | — | |
| TimeSformerPre-train=IN, Frames=32, Bounding Boxes=false2021.10 | 80 | — | |
| TimeSformer + STRGPre-train=IN, Frames=322021.10 | 78.1 | — | |
| TimeSformer-HRFLOPs x clips=1703 G x 32021.11 | 78 | — | |
| TformerAttention=Divided-ST, ViT Architecture=ViT-B, Pretraining=IN-1K, Clip Size=16 x 448^22022.03 | 78 | — | |
| TimeSformer-HR2026.04 | 78 | — | |
| SlowFast-R101FLOPs x clips=213 G x 32021.11 | 77.6 | — | |
| SlowFastPretraining=IN-1K, Clip Size=16 x 224^22022.03 | 77.6 | — | |
| SlowFast, R101Pre-train=K400, Frames=162021.10 | 77.6 | — | |
| Frame2Freq-STBackbone=ViT-B/16, Pretrain=CLIP, Param (M)=3.6, Fine-tuning Framework Type=Parameter Efficient Fine-tuning Frameworks2026.02 | 75.1 | — | |
| TimeSformerFLOPs x clips=196 G x 32021.11 | 75 | — | |
| TformerAttention=Divided-ST, ViT Architecture=ViT-B, Pretraining=IN-1K, Clip Size=8 x 224^22022.03 | 74.9 | — | |
| TimeSformerPre-train=IN, Frames=162021.10 | 74.9 | — | |
| H-MoRe2025.04 | 72.99 | 97.62 | |
| H-MoReNumber of Parameters=~5.7M2025.04 | 72.99 | 97.62 | |
| H-MoReClassifier=TSN, Params (M)=4.7 + 5.572025.04 | 72.69 | 97.6 | |
| GMFlow2025.04 | 71.74 | 95.51 | |
| 3D PoseNumber of Parameters=~41M, Feature Extractor=ST-GCN [58]2025.04 | 71.51 | 97.09 | |
| VideoFlow2025.04 | 71.45 | 96.72 | |
| SKFlow2025.04 | 71.39 | 96.64 | |
| CRAFT2025.04 | 71.24 | 95.85 | |
| VideoFlowClassifier=TSN, Params (M)=4.6 + 12.652025.04 | 71.07 | 96.8 | |
| GMFlowClassifier=TSN, Params (M)=4.6 + 4.682025.04 | 70.91 | 95.89 | |
| FlowFormer++Classifier=TSN, Params (M)=4.6 + 16.152025.04 | 70.66 | 95.94 | |
| 2D PoseNumber of Parameters=~25M, Feature Extractor=ST-GCN [58]2025.04 | 70.66 | 96.11 | |
| CRAFTClassifier=TSN, Params (M)=4.6 + 6.302025.04 | 70.2 | 95.74 | |
| GMAClassifier=TSN, Params (M)=4.6 + 5.882025.04 | 69.54 | 94.77 | |
| GMA2025.04 | 69 | 95.62 | |
| SKFlowClassifier=TSN, Params (M)=4.6 + 6.272025.04 | 67.26 | 94.57 | |
| RAFTClassifier=TSN, Params (M)=4.6 + 5.252025.04 | 66.09 | 93.45 | |
| RAFT2025.04 | 65.9 | 95.42 | |
| w/o FlowClassifier=TSN, Params (M)=4.52025.04 | 65.58 | 95.18 | |
| FlowFormer++2025.04 | 64.28 | 95.88 | |
| w/o Flow2025.04 | 64.07 | 95.08 | |
| SELFYNet-TSM-R50#frame=16, FLOPs x clips=77 G x 22021.02 | 41.6 | — | |
| GSM-IncV3#frame=16, FLOPs x clips=54 G x 22021.02 | 40.3 | — | |
| GST-R50#frame=16, FLOPs x clips=59 G x 12021.02 | 38.8 | — | |
| TSM-R50 (our impl.)#frame=16, FLOPs x clips=65 G x 22021.02 | 38.8 | — | |
| CorrNet-R101#frame=32, FLOPs x clips=187 G x 102021.02 | 38.2 | — | |
| Att-LSTM#frame=64, FLOPs x clips=N/A x 12021.02 | 35.6 | — | |
| C3D#frame=16, FLOPs x clips=N/A x 12021.02 | 34.5 | — | |
| P3D#frame=16, FLOPs x clips=N/A x 12021.02 | 32.4 | — | |
| TRN#frame=null, FLOPs x clips=null2021.02 | 22.8 | — | |
| TSN#frame=null, FLOPs x clips=null2021.02 | 16.8 | — |