Video Classification on Something-Something v2
75.3Top-1 AccMOSS-L
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MOSS-Lbackbone=ViT-L/14, pre-train=Merged-2B, input=16×6, TFLOPs=1.67×6, protocol=Frozen backbone2026.04 | 75.3 | — | — | |
| Side4Videobackbone=ViT-E/14, pre-train=Merged-2B, input=16×6, TFLOPs=15.96×6, protocol=Frozen backbone2026.04 | 75.2 | — | — | |
| MAWSPre-training Dataset=IG-3B, Arch.=ViT-L, Res.=2242023.03 | 74.4 | — | — | |
| MOSS-Lbackbone=ViT-L/14, pre-train=CLIP400M, input=16×6, TFLOPs=1.67×6, protocol=Frozen backbone2026.04 | 74.4 | — | — | |
| V-JEPAbackbone=ViT-H/16, pre-train=VM2M, input=16×6, protocol=Frozen backbone2026.04 | 74.3 | — | — | |
| OmniMAEPre-training Dataset=IN1k + SSv2, Arch.=ViT-L, Res.=2242023.03 | 74.2 | — | — | |
| MAEPre-training Dataset=K400, Arch.=ViT-L, Res.=2242023.03 | 74 | — | — | |
| V-JEPA 2backbone=ViT-H/16, pre-train=VM22M, input=16×6, protocol=Frozen backbone2026.04 | 74 | — | — | |
| MoTEDbackbone=ViT-L/14, pre-train=CLIP400M, input=32×3, TFLOPs=2.89×3, protocol=Frozen backbone2026.04 | 73.8 | — | — | |
| MAEpre-train set=K700, # pre-train data=537k, Backbone=ViT-L, pre-training epochs=16002022.05 | 73.6 | — | — | |
| MAEpre-train set=IG-uncurated, # pre-train data=1M, Backbone=ViT-L, pre-training epochs=16002022.05 | 73.6 | — | — | |
| Qian et al.backbone=ViT-L/14, pre-train=CLIP400M, input=32×3, TFLOPs=1.69×3, protocol=Frozen backbone2026.04 | 73.6 | — | — | |
| ATMbackbone=ViT-L/14, pre-train=CLIP400M, input=16×6, TFLOPs=0.84×6, protocol=Full finetuning2026.04 | 73.5 | — | — | |
| Side4Videobackbone=ViT-L/14, pre-train=CLIP400M, input=16×6, TFLOPs=1.74×6, protocol=Frozen backbone2026.04 | 73.2 | — | — | |
| DiSTbackbone=ViT-L/14, pre-train=CLIP400M, input=32×3, TFLOPs=2.83×3, protocol=Frozen backbone2026.04 | 73.1 | — | — | |
| MOSS-Lbackbone=ViT-L/14, pre-train=CLIP400M, input=8×6, TFLOPs=0.83×6, protocol=Frozen backbone2026.04 | 73.1 | — | — | |
| MAEpre-train set=K600, # pre-train data=387k, Backbone=ViT-L, pre-training epochs=16002022.05 | 73 | — | — | |
| UniFormerV2backbone=ViT-L/14, pre-train=CLIP400M, input=32×3, TFLOPs=1.73×3, protocol=Full finetuning2026.04 | 73 | — | — | |
| MOSS-Bbackbone=ViT-B/16, pre-train=CLIP400M, input=16×6, TFLOPs=0.36×6, protocol=Frozen backbone2026.04 | 72.4 | — | — | |
| ST-Adapterbackbone=ViT-L/14, pre-train=CLIP400M, input=32×3, TFLOPs=2.75×3, protocol=Frozen backbone2026.04 | 72.3 | — | — | |
| DualPathbackbone=ViT-L/14, pre-train=CLIP400M, input=48×3, TFLOPs=0.72×3, protocol=Frozen backbone2026.04 | 72.2 | — | — | |
| MAEpre-train set=K400, # pre-train data=240k, Backbone=ViT-L, pre-training epochs=16002022.05 | 72.1 | — | — | |
| StructViT-B-4-1pretrain=K400, frame x crop x clip=32x3x1, FLOPs (G)=19632024.04 | 71.5 | 93.1 | — | |
| Side4Videobackbone=ViT-B/16, pre-train=CLIP400M, input=16×6, TFLOPs=0.36×6, protocol=Frozen backbone2026.04 | 71.5 | — | — | |
| OMNIVORE (Swin-B)Modality=RGB-only2022.01 | 71.4 | 93.5 | — | |
| MOSS-Bbackbone=ViT-B/16, pre-train=CLIP400M, input=8×6, TFLOPs=0.18×6, protocol=Frozen backbone2026.04 | 71.4 | — | — | |
| UniFormer-Bpretrain=K400, frame x crop x clip=32x3x1, FLOPs (G)=7772024.04 | 71.2 | 92.8 | — | |
| StructViT-B-4-2pretrain=K400, frame x crop x clip=32x3x1, FLOPs (G)=7842024.04 | 71.1 | 92.7 | — | |
| COVERModality=RGB-only2022.01 | 70.9 | — | — | |
| AIMbackbone=ViT-L/14, pre-train=CLIP400M, input=32×3, TFLOPs=3.84×3, protocol=Frozen backbone2026.04 | 70.6 | — | — | |
| MViTv2-Bpretrain=K400, frame x crop x clip=32x3x1, FLOPs (G)=6752024.04 | 70.5 | 92.7 | — | |
| VideoSwin-BModality=RGB-only2022.01 | 69.6 | 92.7 | — | |
| Swin-BBackbone protocol=Finetuned, Zero-shot capability=false2023.04 | 69.6 | — | — | |
| Swin-Bpretrain=K400, frame x crop x clip=32x3x1, FLOPs (G)=9632024.04 | 69.6 | 92.7 | — | |
| ORVITModality=RGB-only2022.01 | 69.5 | 91.5 | — | |
| MMLModality=Multi-modal2022.01 | 69.1 | 92.1 | — | |
| OmniCLIPbackbone=ViT-B/16, pre-train=CLIP400M, input=32×3, TFLOPs=0.8×3, protocol=Frozen backbone2026.04 | 69.1 | — | — | |
| StructViT-S-8-1pretrain=K400, frame x crop x clip=16x3x1, FLOPs (G)=4052024.04 | 69 | 92.1 | — | |
| StructViT-S-4-1pretrain=K400, frame x crop x clip=16x3x1, FLOPs (G)=2462024.04 | 68.8 | 91.9 | — | |
| MVIT-B-24Modality=RGB-only2022.01 | 68.7 | 91.5 | — | |
| MViT-B-24, 32x3pretrain=K600, frame x crop x clip=32x1x3, FLOPs (G)=7082024.04 | 68.7 | 91.5 | — | |
| StructViT-S-4-2pretrain=K400, frame x crop x clip=16x3x1, FLOPs (G)=1262024.04 | 68.3 | 91.3 | — | |
| VIMPACModality=RGB-only2022.01 | 68.1 | — | — | |
| MFormer-LModality=RGB-only2022.01 | 68.1 | 91.2 | — | |
| Mformer-Lpretrain=K400, frame x crop x clip=32x3x1, FLOPs (G)=35552024.04 | 68.1 | 91.2 | — | |
| MViT-B, 64x3pretrain=K400, frame x crop x clip=64x1x3, FLOPs (G)=13652024.04 | 67.7 | 90.9 | — | |
| UniFormer-Spretrain=K400, frame x crop x clip=16x3x1, FLOPs (G)=1252024.04 | 67.7 | 91.4 | — | |
| M2CLIPbackbone=ViT-B/16, pre-train=CLIP400M, input=16×12, protocol=Frozen backbone2026.04 | 67.3 | — | — | |
| Mformer-HRpretrain=K400, frame x crop x clip=16x3x1, FLOPs (G)=28762024.04 | 67.1 | 90.6 | — | |
| EVLbackbone=ViT-L/14, pre-train=CLIP400M, input=32×3, TFLOPs=3.21×3, protocol=Frozen backbone2026.04 | 66.7 | — | — | |
| RSANetpretrain=IN-1K, frame x crop x clip=16x1x1, FLOPs (G)=722024.04 | 66 | 89.9 | — | |
| ViViT-LModality=RGB-only2022.01 | 65.9 | 89.9 | — | |
| ViViTBackbone protocol=Finetuned, Zero-shot capability=false2023.04 | 65.9 | — | — | |
| ViViTbackbone=L/16×2 FE, pre-train=IN21K,K400, input=32×12, TFLOPs=1.0×12, protocol=Full finetuning2026.04 | 65.9 | — | — | |
| SELFYNetpretrain=IN-1K, frame x crop x clip=16x1x1, FLOPs (G)=772024.04 | 65.7 | 89.8 | — | |
| MAEpre-train set=ImageNet-1K, # pre-train data=1.28M, Backbone=ViT-L2022.05 | 65.6 | — | — | |
| ViViT-Lpretrain=K400, frame x crop x clip=16x3x4, FLOPs (G)=118922024.04 | 65.4 | 89.8 | — | |
| X-ViTpretrain=IN-21K, frame x crop x clip=32x3x1, FLOPs (G)=12702024.04 | 65.4 | 90.7 | — | |
| TDNpretrain=IN-1K, frame x crop x clip=16x1x1, FLOPs (G)=722024.04 | 65.3 | 89.5 | — | |
| MSNetpretrain=IN-1K, frame x crop x clip=16x1x1, FLOPs (G)=1012024.04 | 64.7 | 89.4 | — | |
| EVERESTBackbone=ViT-B, Extra data=None2022.11 | 64.6 | — | — | |
| CT-Netpretrain=IN-1K, frame x crop x clip=16x1x1, FLOPs (G)=752024.04 | 64.5 | 89.3 | — | |
| VideoMAEBackbone=ViT-B, Extra data=None2022.11 | 64.3 | — | — | |
| TSMBackbone protocol=Finetuned, Zero-shot capability=false2023.04 | 63.4 | — | — | |
| SlowFastModality=RGB-only2022.01 | 63 | 88.5 | — | |
| TimeSformer-HRpretrain=IN-21K, frame x crop x clip=96x3x1, FLOPs (G)=51092024.04 | 62.5 | — | — | |
| TimeSformerModality=RGB-only2022.01 | 62.4 | — | — | |
| TimeSformer-Lpretrain=IN-21K, frame x crop x clip=16x3x1, FLOPs (G)=71402024.04 | 62.3 | — | — | |
| SlowFastBackbone protocol=Finetuned, Zero-shot capability=false2023.04 | 61.7 | — | — | |
| ρBYOLρ=2Backbone=SR50, Extra data=K4002022.11 | 55.8 | — | — | |
| Supervisedpre-train set=K400, # pre-train data=240k, Backbone=ViT-L2022.05 | 55.7 | — | — | |
| RSPNetBackbone=S3D-G, Extra data=K4002022.11 | 55 | — | — | |
| ρMoCoρ=2Backbone=SR50, Extra data=K4002022.11 | 54.4 | — | — | |
| ρSwAVρ=2Backbone=SR50, Extra data=K4002022.11 | 51.7 | — | — | |
| Supervisedpre-train set=ImageNet-1K, # pre-train data=1.28M, Backbone=ViT-L2022.05 | 50.2 | — | — | |
| TRNBackbone protocol=Finetuned, Zero-shot capability=false2023.04 | 48.8 | — | — | |
| Vita-CLIP B/16Backbone protocol=Frozen, Zero-shot capability=true, Mc=8, Ms=82023.04 | 48.7 | — | — | |
| B2Backbone protocol=Frozen, Zero-shot capability=true2023.04 | 38.1 | — | — | |
| DINOArch=ViT-B/8, Protocol=Frozen linear probe, Input frames=82023.04 | — | — | 32.6 | |
| DINOv2Arch=ViT-S/14, Protocol=Frozen linear probe, Input frames=82023.04 | — | — | 33.1 | |
| DINOv2Arch=ViT-B/14, Protocol=Frozen linear probe, Input frames=82023.04 | — | — | 34.4 | |
| DINOv2Arch=ViT-L/14, Protocol=Frozen linear probe, Input frames=82023.04 | — | — | 35.6 | |
| DINOv2Arch=ViT-g/14, Protocol=Frozen linear probe, Input frames=82023.04 | — | — | 38.3 | |
| iBOTArch=ViT-L/16, Protocol=Frozen linear probe, Input frames=82023.04 | — | — | 38.7 | |
| MAEArch=ViT-H/14, Protocol=Frozen linear probe, Input frames=82023.04 | — | — | 29.2 | |
| OpenCLIPArch=ViT-G/14, Protocol=Frozen linear probe, Input frames=82023.04 | — | — | 35.8 |