Action Classification on Kinetics 400
92.1Top-1 AccInternVideo2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| InternVideo2Type=VLM2026.03 | 92.1 | — | |
| VideoMAE V2-gViews=2 x 3, TFLOPs=160.3, Resolution=224x224, Frames=642023.03 | 90 | 98.4 | |
| MTV-HViews=4 x 3, TFLOPs=73.57, Pretraining Data=WTS, Resolution=280x2802023.03 | 89.9 | 98.3 | |
| VideoMAE V2-HViews=4 x 3, TFLOPs=153.34, Resolution=288x288, Frames=642023.03 | 89.8 | 98.3 | |
| MTV-HViews=4 x 3, TFLOPs=44.47, Pretraining Data=WTS2023.03 | 89.1 | 98.2 | |
| VideoMAE V2-HViews=5 x 3, TFLOPs=17.882023.03 | 88.6 | 97.9 | |
| VideoMAE V2-gViews=5 x 3, TFLOPs=38.162023.03 | 88.5 | 98.1 | |
| VideoMAEViews=4 x 3, TFLOPs=88.76, Resolution=320p2023.03 | 87.4 | 97.6 | |
| CoVeRViews=1 x 3, Pretraining Data=JFT-3B2023.03 | 87.2 | — | |
| MaskFeat^352Backbone=MVIT-L, Extra data=Kinetics-600, Extra labels=false, Pre. Epochs=N/A, Frames=40, GFLOPs=3790x4x3, Param=2182022.11 | 87 | 97.4 | |
| MaskFeatViews=4 x 3, TFLOPs=45.48, Resolution=352p2023.03 | 87 | 97.4 | |
| MAE-STViews=7 x 3, TFLOPs=25.052023.03 | 86.8 | 97.2 | |
| VideoMAEViews=5 x 3, TFLOPs=17.882023.03 | 86.6 | 97.1 | |
| MViTv2-LViews=3 x 5, TFLOPs=42.42, Resolution=312p2023.03 | 86.1 | 97 | |
| VideoMAE 320Backbone=ViT-L, Extra data=no external data, Extra labels=false, Pre. Epochs=1600, Frames=16, GFLOPs=3958x5x3, Param=3052022.11 | 85.8 | 97.1 | |
| SpatioTemporalMAEBackbone=ViT-H, Extra data=no external data, Extra labels=false, Pre. Epochs=1600, Frames=16, GFLOPs=1193x3x7, Param=6322022.11 | 85.1 | 96.6 | |
| MaskFeatViews=1 x 10, TFLOPs=3.782023.03 | 85.1 | 96.6 | |
| ViViTBackbone=ViT-H, Extra data=JFT-300M, Extra labels=true, Pre. Epochs=N/A, Frames=32, GFLOPs=3981x4x3, Param=N/A2022.11 | 84.9 | 95.8 | |
| SpatioTemporalMAEBackbone=ViT-L, Extra data=no external data, Extra labels=false, Pre. Epochs=1600, Frames=16, GFLOPs=598x3x7, Param=3052022.11 | 84.8 | 96.2 | |
| OmniMAEBackbone=ViT-H, Extra data=no external data, Extra labels=false, Pre. Epochs=1600, Frames=16, GFLOPs=1193x3x7, Param=6322022.11 | 84.8 | — | |
| VideoMAEBackbone=ViT-L, Extra data=no external data, Extra labels=false, Pre. Epochs=1600, Frames=16, GFLOPs=597x5x3, Param=3052022.11 | 84.7 | 96.5 | |
| MaskFeatBackbone=MVIT-L, Extra data=no external data, Extra labels=false, Pre. Epochs=N/A, Frames=16, GFLOPs=377x10x1, Param=2182022.11 | 84.3 | 96.3 | |
| FlamingoModel Size=80B2023.12 | 84.2 | — | |
| OmniMAE^512Backbone=ViT-L, Extra data=IN1K + SSv2, Extra labels=false, Pre. Epochs=1600, Frames=16, GFLOPs=598x3x7, Param=3042022.11 | 84 | — | |
| ViViT FEBackbone=ViT-L, Extra data=JFT-300M, Extra labels=true, Pre. Epochs=N/A, Frames=128, GFLOPs=3980x1x3, Param=N/A2022.11 | 83.5 | 94.3 | |
| Video SwinBackbone=Swin-L, Extra data=IN21K, Extra labels=true, Pre. Epochs=N/A, Frames=32, GFLOPs=604x4x3, Param=1972022.11 | 83.1 | 95.9 | |
| Video SwinViews=4 x 3, TFLOPs=7.252023.03 | 83.1 | 95.9 | |
| MViTv2-BViews=1 x 5, TFLOPs=1.132023.03 | 82.9 | 95.7 | |
| MTV-BViews=4 x 3, TFLOPs=4.792023.03 | 81.8 | 95 | |
| ViViT FEBackbone=ViT-L, Extra data=IN21K, Extra labels=true, Pre. Epochs=N/A, Frames=128, GFLOPs=3980x1x3, Param=N/A2022.11 | 81.7 | 93.8 | |
| AdaMAEBackbone=ViT-B, Extra data=no external data, Extra labels=false, Pre. Epochs=800, Frames=16, GFLOPs=180x5x3, Param=872022.11 | 81.7 | 95.2 | |
| ViViT-L FEViews=1 x 3, TFLOPs=11.942023.03 | 81.7 | 93.8 | |
| SpatioTemporalMAEBackbone=ViT-B, Extra data=no external data, Extra labels=false, Pre. Epochs=1600, Frames=16, GFLOPs=180x3x7, Param=872022.11 | 81.3 | 94.9 | |
| MViT-BViews=3 x 3, TFLOPs=4.12023.03 | 81.2 | 95.1 | |
| VideoMAEBackbone=ViT-B, Extra data=no external data, Extra labels=false, Pre. Epochs=1600, Frames=16, GFLOPs=180x5x3, Param=872022.11 | 80.9 | 94.7 | |
| TimeSformerBackbone=ViT-L, Extra data=IN21K, Extra labels=true, Pre. Epochs=N/A, Frames=96, GFLOPs=8353x1x3, Param=4302022.11 | 80.7 | 94.7 | |
| TimeSformer-LViews=1 x 3, TFLOPs=7.142023.03 | 80.7 | 94.7 | |
| Video SwinBackbone=Swin-B, Extra data=IN1K, Extra labels=true, Pre. Epochs=N/A, Frames=32, GFLOPs=282x4x3, Param=882022.11 | 80.6 | 94.6 | |
| BEVTBackbone=Swin-B, Extra data=IN1K+DALLE, Extra labels=false, Pre. Epochs=N/A, Frames=32, GFLOPs=282x4x3, Param=882022.11 | 80.6 | — | |
| OmniMAEBackbone=ViT-B, Extra data=no external data, Extra labels=false, Pre. Epochs=1600, Frames=16, GFLOPs=180x3x7, Param=872022.11 | 80.6 | — | |
| MotionformerBackbone=ViT-L, Extra data=IN21K, Extra labels=true, Pre. Epochs=N/A, Frames=32, GFLOPs=1185x10x3, Param=3822022.11 | 80.2 | 94.8 | |
| MViTv1Backbone=MViTv1-B, Extra data=no external data, Extra labels=false, Pre. Epochs=N/A, Frames=32, GFLOPs=170x5x1, Param=372022.11 | 80.2 | 94.4 | |
| SlowFastBackbone=R101+NL, Extra data=no external data, Extra labels=false, Pre. Epochs=N/A, Frames=16+64, GFLOPs=234x10x3, Param=602022.11 | 79.8 | 93.9 | |
| SlowFast R101-NLViews=10 x 3, TFLOPs=7.022023.03 | 79.8 | 93.9 | |
| MotionformerBackbone=ViT-B, Extra data=IN21K, Extra labels=true, Pre. Epochs=N/A, Frames=16, GFLOPs=370x10x3, Param=1092022.11 | 79.7 | 94.2 | |
| TDN EnBackbone=ResNet101x2, Extra data=IN1K, Extra labels=true, Pre. Epochs=N/A, Frames=8+16, GFLOPs=198x10x3, Param=882022.11 | 79.4 | 94.4 | |
| TDNViews=10 x 3, TFLOPs=5.942023.03 | 79.4 | 94.4 | |
| TANetBackbone=ResNet152, Extra data=IN1K, Extra labels=true, Pre. Epochs=N/A, Frames=16, GFLOPs=242x4x3, Param=592022.11 | 79.3 | 94.1 | |
| TimeSformerBackbone=ViT-B, Extra data=IN21K, Extra labels=true, Pre. Epochs=N/A, Frames=8, GFLOPs=196x1x3, Param=1212022.11 | 78.3 | 93.7 | |
| ip-CSNBackbone=ResNet152, Extra data=no external data, Extra labels=false, Pre. Epochs=N/A, Frames=32, GFLOPs=109x10x3, Param=332022.11 | 77.8 | 92.8 | |
| I3D NLViews=10 x 3, TFLOPs=10.772023.03 | 77.7 | 93.3 | |
| VIMPACBackbone=ViT-L, Extra data=HowTo100M+DALLE, Extra labels=false, Pre. Epochs=N/A, Frames=10, GFLOPs=N/Ax10x3, Param=3072022.11 | 77.4 | — | |
| NL I3DBackbone=ResNet101, Extra data=IN1K, Extra labels=true, Pre. Epochs=N/A, Frames=128, GFLOPs=359x10x3, Param=622022.11 | 77.3 | 93.3 | |
| UIO-2XXLModel Size=XXL2023.12 | 73.8 | — | |
| UIO-2XLModel Size=XL2023.12 | 71.4 | — | |
| UIO-2LModel Size=L2023.12 | 68.5 | — | |
| TrajViT-2Probing Method=attentive probe2026.02 | 59.1 | — | |
| FlamingoModel Size=9B, Few-shot=true2023.12 | 57.4 | — | |
| TrajViTBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | 55.6 | — | |
| TrajViTProbing Method=attentive probe2026.02 | 55.3 | — | |
| ViT3DProbing Method=attentive probe2026.02 | 54.2 | — | |
| ViT3DBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | 53.4 | — | |
| TokenLearnerBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | 53.1 | — | |
| RLTBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | 53.1 | — | |
| TokenLearnerProbing Method=attentive probe2026.02 | 52.9 | — | |
| RLTProbing Method=attentive probe2026.02 | 52.5 | — | |
| ViViTProbing Method=attentive probe2026.02 | 51.2 | — | |
| ViViTBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | 51 | — | |
| ToMeBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | 50.3 | — | |
| ImageBindZero-shot=true2023.12 | 50 | — | |
| AutoMergeBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | 49.3 | — | |
| AutoMergeZero-shot=true2025.05 | — | 38.4 | |
| RLTZero-shot=true2025.05 | — | 41 | |
| TokenLearnerZero-shot=true2025.05 | — | 40.9 | |
| ToMeZero-shot=true2025.05 | — | 38.2 | |
| TrajViTZero-shot=true2025.05 | — | 42.4 | |
| ViT3DZero-shot=true2025.05 | — | 42 | |
| ViViTZero-shot=true2025.05 | — | 39.9 |