Video Classification on Kinetics-400 83 (test)
90Top-1 AccVideoMAE V2-g
Evaluation Results
| Method | Links | |
|---|---|---|
| VideoMAE V2-gPre-training=Large-scale, Resolution=266x266, #frames=64, GFLOPs × views=26716×3×22023.08 | 90 | |
| MTV-HPre-training=Large-scale, Resolution=280x280, #frames=32, GFLOPs × views=6130×3×42023.08 | 89.9 | |
| TAdaFormer-L/14Pre-training=CLIP+K710, #frames=64, #param.=364M, GFLOPs × views=2812×3×42023.08 | 89.9 | |
| UniFormerV2-L/14Pre-training=CLIP+K710, #frames=32, #param.=354M, GFLOPs × views=~2667×3×42023.08 | 89.5 | |
| TAdaFormer-L/14Pre-training=CLIP+K710, #frames=32, #param.=364M, GFLOPs × views=1406×3×42023.08 | 89.5 | |
| UniFormerV2-L/14Pre-training=CLIP+K710, #frames=16, #param.=354M, GFLOPs × views=~1334×3×42023.08 | 89.1 | |
| TAdaFormer-L/14Pre-training=CLIP+K710, #frames=16, #param.=364M, GFLOPs × views=703×3×42023.08 | 88.9 | |
| UniFormerV2-L/14Pre-training=CLIP+K710, #frames=8, #param.=354M, GFLOPs × views=~667×3×42023.08 | 88.8 | |
| TAdaFormer-L/14Pre-training=CLIP, #frames=16, #param.=364M, GFLOPs × views=703×3×42023.08 | 87.6 | |
| EVL ViT-L/14Pre-training=CLIP, #frames=32, #param.=363M, GFLOPs × views=2696×3×12023.08 | 87.3 | |
| CoVeRPre-training=JFT-3B, #frames=162023.08 | 87.2 | |
| ST-Adapter-L/14Pre-training=CLIP, #frames=32, #param.=347M, GFLOPs × views=2749×3×12023.08 | 87.2 | |
| X-CLIP-L/14Pre-training=CLIP, #frames=8, GFLOPs × views=658×3×42023.08 | 87.1 | |
| MaskFeatPre-training=Large-scale, #frames=40, #param.=218M, GFLOPs × views=3790×3×42023.08 | 87 | |
| TAdaFormer-B/16Pre-training=CLIP+K710, #frames=16, #param.=104.1M, GFLOPs × views=153×3×42023.08 | 86.6 | |
| TAdaConvNeXtV2-BPre-training=CLIP+K710, #frames=32, #param.=145.7M, GFLOPs × views=324×3×42023.08 | 86.4 | |
| TAdaConvNeXtV2-SPre-training=CLIP+K710, #frames=32, #param.=82.2M, GFLOPs × views=183×3×42023.08 | 86.1 | |
| UniFormerV2-B/16Pre-training=CLIP+K710, #frames=8, #param.=115M, GFLOPs × views=~150×3×42023.08 | 85.6 | |
| MARPre-training=Large-scale, #frames=16, #param.=311M, GFLOPs × views=276×3×52023.08 | 85.3 | |
| MAE-STPre-training=Large-scale, #frames=16, #param.=632M, GFLOPs × views=1193×3×72023.08 | 85.1 | |
| X-CLIP-B/16Pre-training=CLIP, #frames=16, GFLOPs × views=287×3×42023.08 | 84.7 | |
| TAdaFormer-B/16Pre-training=CLIP, #frames=16, #param.=104.1M, GFLOPs × views=153×3×42023.08 | 84.5 | |
| UniFormerV2-B/16Pre-training=CLIP, #frames=8, #param.=115M, GFLOPs × views=~150×3×42023.08 | 84.4 | |
| EVL ViT-B/16Pre-training=CLIP, #frames=32, #param.=115M, GFLOPs × views=592×3×12023.08 | 84.2 | |
| ViFi-CLIPPre-training=CLIP, #frames=16, #param.=124.7M, GFLOPs × views=281×4×32023.08 | 83.9 | |
| ST-Adapter-B/16Pre-training=CLIP, #frames=32, #param.=93M, GFLOPs × views=607×3×12023.08 | 82 |