Video Action Recognition on SSV2 (test)
74.3Top-1 AccuracyPKS4
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PKS4Backbone=ViT-L/14, Pre-train=CLIP, Resolution=224×224, Views=32×1×3, Trainable Params=312.8M, GFLOPs=7713.62026.04 | 74.3 | 94.3 | |
| PKS4Backbone=ViT-L/14, Pre-train=CLIP, Resolution=224×224, Views=16×1×3, Trainable Params=312.8M, GFLOPs=3857.42026.04 | 73.9 | 94 | |
| DiSTBackbone=ViT-L/14, Pre-train=CLIP, Resolution=224×224, Views=32×3×1, GFLOPs=84902026.04 | 73.1 | 93.2 | |
| ST-AdapterBackbone=ViT-L/14, Pre-train=CLIP, Resolution=224×224, Views=32×3×1, GFLOPs=82482026.04 | 72.3 | 93.9 | |
| PKS4Backbone=ViT-B/16, Pre-train=CLIP, Resolution=224×224, Views=32×1×3, Trainable Params=91.7M, GFLOPs=17452026.04 | 71.7 | 93.3 | |
| DUALPATHBackbone=ViT-L/14, Pre-train=CLIP, Resolution=224×224, Views=32×1×3, Trainable Params=33M, GFLOPs=19322026.04 | 71.4 | 93.4 | |
| VideoMambaBackbone=VideoMamba-M800e, Pre-train=CLIP, Resolution=288×288, Views=16×3×2, Trainable Params=74M, GFLOPs=19982026.04 | 71.4 | 92.9 | |
| DiSTBackbone=ViT-B/16, Pre-train=CLIP, Resolution=224×224, Views=32×3×1, GFLOPs=19502026.04 | 70.9 | 92.1 | |
| AIMBackbone=ViT-L/14, Pre-train=CLIP, Resolution=224×224, Views=32×3×1, Trainable Params=50M, GFLOPs=115082026.04 | 70.6 | 92.7 | |
| DUALPATHBackbone=ViT-B/16, Pre-train=CLIP, Resolution=224×224, Views=32×1×3, Trainable Params=13M, GFLOPs=7162026.04 | 70.3 | 92.9 | |
| PKS4Backbone=ViT-B/16, Pre-train=CLIP, Resolution=224×224, Views=8×2×3, Trainable Params=91.7M, GFLOPs=8742026.04 | 70.3 | 92.4 | |
| VideoMambaBackbone=VideoMamba-M800e, Pre-train=CLIP, Resolution=224×224, Views=8×3×2, Trainable Params=74M, GFLOPs=6062026.04 | 70.2 | 92.6 | |
| SwinTransformerBackbone=ViT-B/16, Pre-train=K400, Resolution=224×224, Views=32×1×3, Trainable Params=88.8M, GFLOPs=9632026.04 | 69.6 | 92.7 | |
| ST-AdapterBackbone=ViT-B/16, Pre-train=CLIP, Resolution=224×224, Views=32×3×1, Trainable Params=14.1M, GFLOPs=19552026.04 | 69.5 | 92.6 | |
| AIMBackbone=ViT-B/16, Pre-train=CLIP, Resolution=224×224, Views=32×3×1, Trainable Params=14M, GFLOPs=24962026.04 | 69.1 | 92.3 | |
| M2-CLIPBackbone=ViT-B/16, Pre-train=CLIP, Resolution=224×224, Views=32×1×3, Trainable Params=16M, GFLOPs=25262026.04 | 69.1 | — | |
| VideoMambaBackbone=VideoMamba-M, Pre-train=IN-1K, Resolution=288×288, Views=16×3×4, Trainable Params=74M, GFLOPs=39962026.04 | 68.4 | 91.6 | |
| VideoMambaBackbone=VideoMamba-S, Pre-train=IN-1K, Resolution=288×288, Views=16×3×2, Trainable Params=26M, GFLOPs=6722026.04 | 68.1 | 91.2 | |
| MTVBackbone=MTV-B, Pre-train=K400, Resolution=224×224, Views=16×4×3, Trainable Params=310M, GFLOPs=111602026.04 | 67.6 | 90.1 | |
| VideoMambaBackbone=VideoMamba-M, Pre-train=IN-1K, Resolution=224×224, Views=8×3×4, Trainable Params=74M, GFLOPs=12122026.04 | 67.3 | 91 | |
| MformerBackbone=ViT-L/14, Pre-train=IN-21K + K400, Resolution=224×224, Views=16×3×1, Trainable Params=381.9M, GFLOPs=2876.42026.04 | 67.1 | 90.6 | |
| EVLBackbone=ViT-L/14, Pre-train=CLIP, Resolution=224×224, Views=32×3×1, GFLOPs=104182026.04 | 66.7 | — | |
| VideoMambaBackbone=VideoMamba-S, Pre-train=IN-1K, Resolution=224×224, Views=8×3×2, Trainable Params=26M, GFLOPs=2042026.04 | 66.6 | 90.4 | |
| MformerBackbone=ViT-B/16, Pre-train=IN-21K + K400, Resolution=224×224, Views=16×3×1, Trainable Params=109.1M, GFLOPs=11092026.04 | 66.5 | 90.1 | |
| ViViT-L/16×2 FEBackbone=ViT-L/16×2 FE, Pre-train=IN-21K + K400, Resolution=224×224, Views=32×1×3, Trainable Params=612M, GFLOPs=119402026.04 | 65.9 | 89.9 | |
| EVLBackbone=ViT-B/16, Pre-train=CLIP, Resolution=224×224, Views=32×3×1, Trainable Params=28.8M, GFLOPs=28242026.04 | 62.4 | — | |
| TimeSformer-LBackbone=ViT-B/16, Pre-train=IN-21K, Resolution=224×224, Views=96×1×3, Trainable Params=121.4M, GFLOPs=71402026.04 | 62.3 | — | |
| TimeSformerBackbone=ViT-B/16, Pre-train=IN-21K, Resolution=224×224, Views=8×1×3, Trainable Params=121.4M, GFLOPs=17702026.04 | 59.5 | — |