Action Classification on Something-Something V2 (val)
77Top-1 Acc (multi-view fusion)VideoMAE V2
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| VideoMAE V2Backbone=ViT-g, Pre-train data=UnlabeledHybrid, Data size=1.35M, Epoch=1200, Input Resolution=16x224x224, Sampling Stride=22023.03 | 77 | 75.7 | — | — | — | |
| VideoMAE V2Backbone=ViT-H, Pre-train data=UnlabeledHybrid, Data size=1.35M, Epoch=1200, Input Resolution=16x224x224, Sampling Stride=22023.03 | 76.8 | 75.5 | — | — | — | |
| VideoMAE V2Backbone=ViT-L, Pre-train data=UnlabeledHybrid, Data size=1.35M, Epoch=1200, Input Resolution=16x224x224, Sampling Stride=22023.03 | 75.7 | 74 | — | — | — | |
| MAE-STBackbone=ViT-H, Pre-train data=Kinetics-700, Data size=0.55M, Epoch=1600, Input Resolution=16x224x224, Sampling Stride=22023.03 | 75.5 | — | — | — | — | |
| VideoMAE V1Backbone=ViT-H, Pre-train data=Something-Something V2, Data size=0.17M, Epoch=2400, Input Resolution=16x224x224, Sampling Stride=22023.03 | 74.8 | — | — | — | — | |
| VideoMAE V1Backbone=ViT-L, Pre-train data=Something-Something V2, Data size=0.17M, Epoch=2400, Input Resolution=16x224x224, Sampling Stride=22023.03 | 74.3 | — | — | — | — | |
| MAE-STBackbone=ViT-H, Pre-train data=Kinetics-400, Data size=0.24M, Epoch=1600, Input Resolution=16x224x224, Sampling Stride=22023.03 | 74.1 | — | — | — | — | |
| MAE-STBackbone=ViT-L, Pre-train data=Kinetics-700, Data size=0.55M, Epoch=1600, Input Resolution=16x224x224, Sampling Stride=22023.03 | 73.6 | — | — | — | — | |
| MAE-STBackbone=ViT-L, Pre-train data=Kinetics-400, Data size=0.24M, Epoch=1600, Input Resolution=16x224x224, Sampling Stride=22023.03 | 72.1 | — | — | — | — | |
| VideoMAE V2Backbone=ViT-B, Pre-train data=UnlabeledHybrid, Data size=1.35M, Epoch=1200, Input Resolution=16x224x224, Sampling Stride=22023.03 | 71.2 | 69.5 | — | — | — | |
| VideoMAE V1Backbone=ViT-B, Pre-train data=Something-Something V2, Data size=0.17M, Epoch=2400, Input Resolution=16x224x224, Sampling Stride=22023.03 | 70.8 | — | — | — | — | |
| AutoMergeBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | — | — | — | — | 41.2 | |
| RLTBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | — | — | — | — | 44.5 | |
| TokenLearnerBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | — | — | — | — | 42.7 | |
| ToMeBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | — | — | — | — | 41.7 | |
| TrajViTBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | — | — | — | — | 45.8 | |
| umt-L-K710-fnK710Backbone=UMT-Large, Pre-training=K710 fine-tuned2025.03 | — | — | — | 57.9 | — | |
| videomae-B-K400Backbone=VideoMAE-Base, Pre-training=Kinetics-4002025.03 | — | — | — | 54.2 | — | |
| ViT3DBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | — | — | — | — | 46.1 | |
| ViViTBackbone=ViT-Large, Training Dataset=Panda-70M (4M), Input Frames=162025.05 | — | — | — | — | 43 |