Action Classification on Epic-Kitchens-100
72.2Top-1 Verb AccuracyMoViNet-A6
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| MoViNet-A6Pre-train=N/A, Run-time(s)=0.85, Mem (GB)=8.3, FLOPs (G)=117, Param (M)=31.42022.01 | 72.2 | 47.7 | 57.3 | — | — | — | — | — | — | |
| MeMViT, 32×3Pre-train=K600, Run-time(s)=0.35, Mem (GB)=3.9, FLOPs (G)=211.7, Param (M)=52.62022.01 | 71.4 | 48.4 | 60.3 | — | — | — | — | — | — | |
| MeMViT, 16×4Pre-train=K400, Run-time(s)=0.16, Mem (GB)=1.7, FLOPs (G)=58.7, Param (M)=35.42022.01 | 70.6 | 46.2 | 58.5 | — | — | — | — | — | — | |
| MoViNet-A5Pre-train=N/A, Run-time(s)=0.49, Mem (GB)=8.3, FLOPs (G)=74.9, Param (M)=15.72022.01 | 69.1 | 44.5 | 55.1 | — | — | — | — | — | — | |
| IPLPre-train=K4002022.01 | 68.6 | 41 | 51.2 | — | — | — | — | — | — | |
| TSMPre-train=IN1K2022.01 | 67.9 | 38.3 | 49 | — | — | — | — | — | — | |
| Ego-ExoPre-train=K4002022.01 | 67 | — | 52.9 | — | — | — | — | — | — | |
| MFormer-HRPre-train=IN21K+K400, FLOPs (G)=959, Param (M)=3822022.01 | 67 | 44.5 | 58.5 | — | — | — | — | — | — | |
| MFormerPre-train=IN21K+K400, FLOPs (G)=370, Param (M)=1092022.01 | 66.7 | 43.1 | 56.5 | — | — | — | — | — | — | |
| ViViT-L/16×2Pre-train=IN21K, FLOPs (G)=3410, Param (M)=1002022.01 | 66.4 | 44 | 56.8 | — | — | — | — | — | — | |
| SlowFast 8×8 + TAdaConvFrames=8+32, GFLOPs=65.73, Params.=37.7M2021.10 | 66.36 | 41.35 | 52.32 | 61.68 | 90.59 | 75.89 | — | — | — | |
| SlowFastPre-train=K4002022.01 | 65.6 | 38.5 | 50 | — | — | — | — | — | — | |
| SlowFast 8×8Frames=8+32, GFLOPs=65.71, Params.=34.5M2021.10 | 65.05 | 40.08 | 50.72 | 60.1 | 90.04 | 74.26 | — | — | — | |
| R(2+1)D + TAdaConv2d+1dFrames=8, GFLOPs=49.58, Params.=34.4M2021.10 | 64.77 | 40.1 | 50.28 | 60.45 | 89.99 | 75.55 | — | — | — | |
| SlowFast 4×16 + TAdaConvFrames=4+32, GFLOPs=36.11, Params.=37.7M2021.10 | 64.5 | 39.14 | 49.59 | 59.21 | 89.67 | 73.88 | — | — | — | |
| R(2+1)D + TAdaConv2dFrames=8, GFLOPs=49.57, Params.=31.3M2021.10 | 64.48 | 39.72 | 50.26 | 60.22 | 90.01 | 75.06 | — | — | — | |
| R3D + TAdaConv3dFrames=8, GFLOPs=84.24, Params.=50.1M2021.10 | 64.03 | 39.3 | 49.94 | 59.67 | 89.84 | 74.56 | — | — | — | |
| SlowFast 4×16Frames=4+32, GFLOPs=36.1, Params.=34.5M2021.10 | 63.54 | 38.17 | 48.79 | 58.68 | 89.75 | 73.37 | — | — | — | |
| R(2+1)DFrames=8, GFLOPs=49.55, Params.=28.1M2021.10 | 62.92 | 37.45 | 48.27 | 58.02 | 89.75 | 73.6 | — | — | — | |
| R3DFrames=8, GFLOPs=84.23, Params.=47.0M2021.10 | 61.92 | 36.67 | 47.87 | 57.47 | 89.02 | 73.05 | — | — | — | |
| TSNPre-train=IN1K2022.01 | 60.2 | 33.2 | 46 | — | — | — | — | — | — | |
| TempAggPre-train=IN1K2022.01 | 59.9 | 36.9 | 45.1 | — | — | — | — | — | — | |
| AST2023.03 | — | — | — | — | — | — | 44.3 | 22.4 | 13 | |
| AudioSlowFast2023.03 | — | — | — | — | — | — | 46.5 | 22.8 | 15.4 | |
| Damen et al.2023.03 | — | — | — | — | — | — | 42.1 | 21.5 | 14.8 | |
| DistantSupPretraining Supervision=Unsupervised: ASR + wikiHow, Pretraining Dataset=HT100M, fine-tuning setting=true2023.03 | — | — | — | — | — | — | 67.1 | 58.1 | 44.4 | |
| MASTPre-training=ImageNet-1K2023.03 | — | — | — | — | — | — | 50.1 | 24.2 | 17.4 | |
| MoViNetfine-tuning setting=true2023.03 | — | — | — | — | — | — | 72.2 | 57.3 | 47.7 | |
| ProcedureVRLPretraining Supervision=Unsupervised: ASR, Pretraining Dataset=HT100M, fine-tuning setting=true2023.03 | — | — | — | — | — | — | 69.5 | 60.3 | 47.7 | |
| SlowFastPretraining Supervision=Supervised: action labels, Pretraining Dataset=Kinetics, fine-tuning setting=true2023.03 | — | — | — | — | — | — | 65.6 | 50 | 38.5 | |
| TBNfine-tuning setting=true2023.03 | — | — | — | — | — | — | 66 | 47.2 | 36.7 | |
| TimeSformerPretraining Supervision=Supervised: action labels, Pretraining Dataset=Kinetics, fine-tuning setting=true2023.03 | — | — | — | — | — | — | 66.6 | 54.4 | 42.3 | |
| TRNfine-tuning setting=true2023.03 | — | — | — | — | — | — | 65.9 | 45.4 | 35.3 | |
| TSMPretraining Supervision=Supervised: action labels, Pretraining Dataset=Kinetics, fine-tuning setting=true2023.03 | — | — | — | — | — | — | 67.9 | 49 | 38.3 | |
| TSNfine-tuning setting=true2023.03 | — | — | — | — | — | — | 60.2 | 46 | 33.2 | |
| ViViT-LPretraining Supervision=Supervised: action labels, Pretraining Dataset=Kinetics, fine-tuning setting=true2023.03 | — | — | — | — | — | — | 66.4 | 56.8 | 44 |