Video Classification on Kinetics 400
89.9Top-1 AccAbsolute SOTA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Absolute SOTAReference=[80]2023.05 | 89.9 | — | — | — | |
| MVD-H (Teacher-H) †extra data=IN-1K, GFLOPs=1192x15, Param=633, Student=ViT-H, Teacher=ViT-H, epochs=8002022.12 | 87.2 | 97.4 | — | — | |
| VideoMAE ViT-HGFLOPs=1192x15, Param=6332022.12 | 86.6 | 97.1 | — | — | |
| MVD-L (Teacher-L) †extra data=IN-1K, GFLOPs=597x15, Param=305, Student=ViT-L, Teacher=ViT-L, epochs=8002022.12 | 86.4 | 97 | — | — | |
| MVD-L (Teacher-L)extra data=IN-1K, GFLOPs=597x15, Param=305, Student=ViT-L, Teacher=ViT-L, epochs=4002022.12 | 86 | 96.9 | — | — | |
| VideoMAE ViT-LGFLOPs=597x15, Param=3052022.12 | 85.2 | 96.8 | — | — | |
| ST-MAE ViT-HGFLOPs=1193x21, Param=6322022.12 | 85.1 | 96.6 | — | — | |
| ST-MAE ViT-LGFLOPs=598x21, Param=3042022.12 | 84.8 | 96.2 | — | — | |
| OmniMAE ViT-Hextra data=IN-1K+SSv2, GFLOPs=1192x15, Param=6332022.12 | 84.8 | — | — | — | |
| DVTAttention=D-ST+MS-A, ViT Architecture=MVIT-B, Pretraining=IN-21K, Clip Size=32 x 224^2, GFLOPs x views=259 x 1 x 52022.03 | 84.7 | 96.2 | — | — | |
| DVTAttention=D-ST+MS-A, ViT Architecture=ViT-B, Pretraining=IN-21K, Clip Size=16 x 448^2, GFLOPs x views=1300 x 1 x 52022.03 | 84.5 | 96.7 | — | — | |
| OMNIVORE (Swin-L)Backbone=Swin-L2022.01 | 84.1 | 96.3 | — | — | |
| OMNIVORE (Swin-B)Backbone=Swin-B2022.01 | 84 | 96.2 | — | — | |
| OmniMAE ViT-Lextra data=IN-1K+SSv2, GFLOPs=597x15, Param=3052022.12 | 84 | — | — | — | |
| MVD-B (Teacher-L)extra data=IN-1K, GFLOPs=180x15, Param=87, Student=ViT-B, Teacher=ViT-L, epochs=4002022.12 | 83.4 | 95.8 | — | — | |
| SMILEBackbone=ViT-B, Epochs=1200, Pretrain=K400, Params=87M2025.04 | 83.4 | — | — | — | |
| VideoSwin-LBackbone=Swin-L2022.01 | 83.1 | 95.9 | — | — | |
| VideoSwin-Lextra data=IN-21K, GFLOPs=604x12, Param=1972022.12 | 83.1 | 95.9 | — | — | |
| SMILEBackbone=ViT-B, Epochs=600, Pretrain=K400, Params=87M2025.04 | 83.1 | — | — | — | |
| SCT-LTFLOPS × Views=0.343×4×3, #Param=60M, Runtime (s)=0.1062021.08 | 83 | 95.4 | — | — | |
| Uniformer-Bextra data=IN-1K, GFLOPs=259x12, Param=502022.12 | 83 | 95.4 | — | — | |
| Uniformer-BBackbone=Lformer-B, Pretrain=K400, Params=50M, Supervised=true2025.04 | 83 | — | — | — | |
| MViTv2Backbone=MViTv2-B, Pretrain=K400, Params=52M, Supervised=true2025.04 | 82.9 | — | — | — | |
| VideoSwin-BBackbone=Swin-B2022.01 | 82.7 | 95.5 | — | — | |
| MVD-B (Teacher-B)extra data=IN-1K, GFLOPs=180x15, Param=87, Student=ViT-B, Teacher=ViT-B, epochs=4002022.12 | 82.7 | 95.4 | — | — | |
| MVDBackbone=ViT-B, Epochs=1600+400, Pretrain=K400, Params=87M2025.04 | 82.7 | — | — | — | |
| MaskFeat MViT-SGFLOPs=71x10, Param=362022.12 | 82.2 | 95.1 | — | — | |
| DVTAttention=D-ST+MS-A, ViT Architecture=ViT-B, Pretraining=IN-21K, Clip Size=16 x 336^2, GFLOPs x views=731 x 1 x 52022.03 | 82 | 95.3 | — | — | |
| MMEBackbone=ViT-B, Epochs=1600, Pretrain=K400, Params=87M2025.04 | 81.8 | — | — | — | |
| MGMAEBackbone=ViT-B, Epochs=1600, Pretrain=K400, Params=87M2025.04 | 81.8 | — | — | — | |
| ViViT-L FEextra data=IN-21K, GFLOPs=3980x32022.12 | 81.7 | 93.8 | — | — | |
| MotionMAEBackbone=ViT-B, Epochs=1600, Pretrain=K400, Params=87M2025.04 | 81.7 | — | — | — | |
| MGMBackbone=ViT-B, Epochs=1600, Pretrain=K400, Params=87M2025.04 | 81.7 | — | — | — | |
| DVTAttention=D-ST+MS-A, ViT Architecture=MVIT-B, Pretraining=IN-21K, Clip Size=16 x 224^2, GFLOPs x views=128 x 1 x 52022.03 | 81.5 | 95.2 | — | — | |
| VideoMAE ViT-BGFLOPs=180x15, Param=872022.12 | 81.5 | 95.1 | — | — | |
| VideoMAEBackbone=ViT-B, Epochs=1600, Pretrain=K400, Params=87M2025.04 | 81.5 | — | — | — | |
| SIGMABackbone=ViT-B, Epochs=800, Pretrain=K400, Params=87M2025.04 | 81.5 | — | — | — | |
| MMEBackbone=ViT-B, Epochs=800, Pretrain=K400, Params=87M, Re-evaluated=true2025.04 | 81.5 | — | — | — | |
| ViViT-LTFLOPS × Views=399.2×4×3, #Param=89M2021.08 | 81.3 | 94.7 | — | — | |
| SCT-MTFLOPS × Views=0.163×4×3, #Param=33M, Runtime (s)=0.0722021.08 | 81.3 | 94.5 | — | — | |
| ViViT-L/16x2 320Backbone=ViT-L, Resolution=3202022.01 | 81.3 | 94.7 | — | — | |
| ViViTAttention=Joint ST, ViT Architecture=ViT-L, Pretraining=IN-21K, Clip Size=16 x 320^2, GFLOPs x views=3992 x 3 x 42022.03 | 81.3 | 94.7 | — | — | |
| ST-MAE ViT-BGFLOPs=180x21, Param=872022.12 | 81.3 | 94.9 | — | — | |
| ST-MAEBackbone=ViT-B, Epochs=1600, Pretrain=K400, Params=87M2025.04 | 81.3 | — | — | — | |
| MViT-B 64×3TFLOPS × Views=0.455×3×3, #Param=37M, Runtime (s)=0.1532021.08 | 81.2 | 95.1 | — | — | |
| MViT-B 64x3Backbone=MViT-B, Input=64x32022.01 | 81.2 | 95.1 | — | — | |
| MGMAEBackbone=ViT-B, Epochs=800, Pretrain=K400, Params=87M2025.04 | 81.2 | — | — | — | |
| MformerAttention=Trajectory, ViT Architecture=ViT-B, Pretraining=IN-21K, Clip Size=16 x 336^2, GFLOPs x views=959 x 3 x 102022.03 | 81.1 | 95.2 | — | — | |
| BEVT Swin-Bextra data=IN-1K, GFLOPs=282x12, Param=882022.12 | 81.1 | — | — | — | |
| MVD-S (Teacher-L)extra data=IN-1K, GFLOPs=57x15, Param=22, Student=ViT-S, Teacher=ViT-L, epochs=4002022.12 | 81 | 94.8 | — | — | |
| CMAE-VBackbone=ViT-B, Epochs=1600, Pretrain=K400, Params=87M2025.04 | 80.9 | — | — | — | |
| DVTAttention=D-ST+MS-A, ViT Architecture=MVIT-B, Pretraining=IN-1K, Clip Size=16 x 224^2, GFLOPs x views=128 x 1 x 52022.03 | 80.8 | 95 | — | — | |
| OmniMAE ViT-Bextra data=IN-1K, GFLOPs=180x15, Param=872022.12 | 80.8 | — | — | — | |
| OmniMAEBackbone=ViT-B, Epochs=800, Pretrain=K400, Params=87M2025.04 | 80.8 | — | — | — | |
| MGMBackbone=ViT-B, Epochs=800, Pretrain=K400, Params=87M2025.04 | 80.8 | — | — | — | |
| TimeSformerTFLOPS × Views=2.38×1×3, #Param=121M, Runtime (s)=0.4752021.08 | 80.7 | 94.7 | — | — | |
| TimeSformer-LModel variant=L2022.01 | 80.7 | 94.7 | — | — | |
| TformerAttention=Divided-ST, ViT Architecture=ViT-B, Pretraining=IN-21K, Clip Size=96 x 224^2, GFLOPs x views=2380 x 3 x 12022.03 | 80.7 | 94.7 | — | — | |
| TimeSformerextra data=IN-21K, GFLOPs=2380x3, Param=1212022.12 | 80.7 | 94.7 | — | — | |
| TimeSformerBackbone=ViT-B, Pretrain=K400, Params=430M, Supervised=true2025.04 | 80.7 | — | — | — | |
| VideoSwin-Bextra data=IN-1K, GFLOPs=282x12, Param=882022.12 | 80.6 | 94.6 | — | — | |
| MVD-S (Teacher-B)extra data=IN-1K, GFLOPs=57x15, Param=22, Student=ViT-S, Teacher=ViT-B, epochs=4002022.12 | 80.6 | 94.7 | — | — | |
| VideoSwinBackbone=Swin-B, Pretrain=K400, Params=88M, Supervised=true2025.04 | 80.6 | — | — | — | |
| BEVTBackbone=ViT-B, Epochs=800+150, Pretrain=K400, Params=87M2025.04 | 80.6 | — | — | — | |
| DVTAttention=D-ST+MS-A, ViT Architecture=ViT-B, Pretraining=IN-21K, Clip Size=16 x 224^2, GFLOPs x views=325 x 1 x 52022.03 | 80.5 | 94.7 | — | — | |
| X3D-XXLTFLOPS × Views=0.194×10×3, #Param=20M, Runtime (s)=0.1762021.08 | 80.4 | 94.6 | — | — | |
| MformerAttention=Trajectory, ViT Architecture=ViT-B, Pretraining=IN-21K, Clip Size=32 x 224^2, GFLOPs x views=1185 x 3 x 102022.03 | 80.2 | 94.8 | — | — | |
| MViTv1-BGFLOPs=170x5, Param=372022.12 | 80.2 | 94.4 | — | — | |
| Mformer-Lextra data=IN-21K, GFLOPs=1185x30, Param=3822022.12 | 80.2 | 94.8 | — | — | |
| MViTv1Backbone=MViTv1-B, Pretrain=K400, Params=37M, Supervised=true2025.04 | 80.2 | — | — | — | |
| CMAE-VBackbone=ViT-B, Epochs=800, Pretrain=K400, Params=87M2025.04 | 80.2 | — | — | — | |
| VideoMAEBackbone=ViT-B, Epochs=800, Pretrain=K400, Params=87M2025.04 | 80 | — | — | — | |
| CT-NetENBackbone=2D R50+R101, #Frame=(16+16)×3×4, GFLOPS=26412021.06 | 79.8 | 94.2 | — | — | |
| SlowFastTFLOPS × Views=0.234×10×3, #Param=60M2021.08 | 79.8 | 93.9 | — | — | |
| ViT-B-VTNBackbone=ViT-B, Model type=VTN2022.01 | 79.8 | 94.2 | — | — | |
| SlowFastClip Size=8 x 224^2, GFLOPs x views=234 x 3 x 102022.03 | 79.8 | 93.9 | — | — | |
| SlowFast NLGFLOPs=234x30, Param=602022.12 | 79.8 | 93.9 | — | — | |
| MformerAttention=Trajectory, ViT Architecture=ViT-B, Pretraining=IN-21K, Clip Size=16 x 224^2, GFLOPs x views=397 x 3 x 102022.03 | 79.7 | 94.2 | — | — | |
| TformerAttention=Divided-ST, ViT Architecture=ViT-B, Pretraining=IN-21K, Clip Size=16 x 448^2, GFLOPs x views=1703 x 3 x 12022.03 | 79.7 | 94.4 | — | — | |
| Mformer-Bextra data=IN-21K, GFLOPs=370x30, Param=1092022.12 | 79.7 | 94.2 | — | — | |
| MformerBackbone=Mformer-B, Pretrain=K400, Params=109M, Supervised=true2025.04 | 79.7 | — | — | — | |
| SMILEBackbone=ViT-S, Epochs=800, Pretrain=K400, Params=22M2025.04 | 79.5 | — | — | — | |
| CorrNetBackbone=3D R101, #Frame=32×3×10, GFLOPS=67202021.06 | 79.2 | — | — | — | |
| CorrNet-101TFLOPS × Views=0.224×10×32021.08 | 79.2 | — | — | — | |
| ip-CSN-152TFLOPS × Views=0.109×10×3, #Param=33M2021.08 | 79.2 | 93.8 | — | — | |
| X3D-XLBackbone=-, #Frame=16×3×10, GFLOPS=14522021.06 | 79.1 | 93.9 | — | — | |
| X3DClip Size=16 x 312^2, GFLOPs x views=48 x 3 x 102022.03 | 79.1 | 93.9 | — | — | |
| X3D-XLGFLOPs=48x30, Param=112022.12 | 79.1 | 93.9 | — | — | |
| DVTAttention=D-ST+MS-A, ViT Architecture=MVIT-B, Clip Size=16 x 224^2, GFLOPs x views=128 x 1 x 52022.03 | 79 | 93.8 | — | — | |
| VideoMAE ViT-SGFLOPs=57x15, Param=222022.12 | 79 | 93.8 | — | — | |
| VideoMAEBackbone=ViT-S, Epochs=1600, Pretrain=K400, Params=22M2025.04 | 79 | — | — | — | |
| SlowFastBackbone=3D R101+R101, #Frame=80=(16+64)×3×10, GFLOPS=63902021.06 | 78.9 | 93.5 | — | — | |
| CT-NetBackbone=2D R101, #Frame=16×3×4, GFLOPS=17462021.06 | 78.8 | 93.7 | — | — | |
| SCT-STFLOPS × Views=0.088×4×3, #Param=19M, Runtime (s)=0.0512021.08 | 78.4 | 93.8 | — | — | |
| MVITAttention=MHPA, ViT Architecture=MVIT-B, Clip Size=16 x 224^2, GFLOPs x views=71 x 1 x 52022.03 | 78.4 | 93.5 | — | — | |
| TformerAttention=Divided-ST, ViT Architecture=ViT-B, Pretraining=IN-21K, Clip Size=8 x 224^2, GFLOPs x views=197 x 3 x 12022.03 | 78 | 93.7 | — | — | |
| SlowFastBackbone=3D R101+R101, #Frame=40=(8+32)×3×10, GFLOPS=31802021.06 | 77.9 | 93.2 | — | — | |
| ip-CSNBackbone=3D R152, #Frame=32×3×10, GFLOPS=32642021.06 | 77.8 | 92.8 | — | — | |
| ip-CSN-152GFLOPs=109x30, Param=332022.12 | 77.8 | 92.8 | — | — | |
| NL I3DBackbone=3D R101, #Frame=128×3×10, GFLOPS=107702021.06 | 77.7 | 93.3 | — | — |