Action Recognition on Something-Something V2 (Top-1 Accuracy)
75.7Top-1 AccuracyTrackMAE
Evaluation Results
| Method | Links | |
|---|---|---|
| TrackMAEBackbone=ViT-L, Targets=CLIP, Epochs=800, Pre-training Dataset=K700, Evaluation Protocol=Full finetuning2026.03 | 75.7 | |
| TrackMAE†Backbone=ViT-L, Targets=CLIP, Evaluation protocol=Full finetuning, Pre-training dataset=K7002026.03 | 75.7 | |
| VideoMAEBackbone=ViT-L, Targets=Pixel, Epochs=1600, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 74 | |
| VideoMAEBackbone=ViT-L, Targets=Pixel, Evaluation protocol=Full finetuning, Pre-training dataset=K4002026.03 | 74 | |
| TrackMAEBackbone=ViT-B, Targets=CLIP, Epochs=800, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 72.8 | |
| TrackMAEBackbone=ViT-B, Targets=CLIP, Evaluation protocol=Full finetuning, Pre-training dataset=K4002026.03 | 72.8 | |
| SMILEBackbone=ViT-B, Targets=CLIP, Epochs=600, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 72.5 | |
| TrackMAEBackbone=ViT-B, Targets=CLIP, Epochs=800, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 72.5 | |
| SMILEBackbone=ViT-B, Targets=CLIP, Epochs=1200, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 72.4 | |
| SMILEBackbone=ViT-B, Targets=CLIP, Epochs=600, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 72.1 | |
| SMILEBackbone=ViT-B, Targets=CLIP, Evaluation protocol=Full finetuning, Pre-training dataset=K4002026.03 | 72.1 | |
| MGMAEBackbone=ViT-B, Targets=Pixel, Epochs=1600, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 72 | |
| MGMBackbone=ViT-B, Targets=Pixel, Epochs=1600, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 71.8 | |
| SIGMABackbone=ViT-B, Targets=DINO, Epochs=800, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 71.2 | |
| Uniformer-BBackbone=Uformer-B, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 71.2 | |
| MGMBackbone=ViT-B, Targets=Pixel, Epochs=800, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 71.1 | |
| SIGMABackbone=ViT-B, Targets=DINO, Epochs=800, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 71.1 | |
| MGMBackbone=ViT-B, Targets=Pixel, Evaluation protocol=Full finetuning, Pre-training dataset=K4002026.03 | 71.1 | |
| SIGMABackbone=ViT-B, Targets=DINO, Evaluation protocol=Full finetuning, Pre-training dataset=K4002026.03 | 71.1 | |
| MGMAEBackbone=ViT-B, Targets=Pixel, Epochs=800, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 71 | |
| MGMBackbone=ViT-B, Targets=Pixel, Epochs=800, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 70.6 | |
| CMAE-VBackbone=ViT-B, Targets=Pixel, Epochs=1600, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 70.5 | |
| MViTv2Backbone=MViTv2-B, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 70.5 | |
| MMEBackbone=ViT-B, Targets=HOG, Epochs=800, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 70.5 | |
| MMEBackbone=ViT-B, Targets=HOG, Evaluation protocol=Full finetuning, Pre-training dataset=K4002026.03 | 70.5 | |
| TrackMAEBackbone=ViT-B, Targets=Pixel, Evaluation protocol=Full finetuning, Pre-training dataset=K4002026.03 | 70.1 | |
| MMEBackbone=ViT-B, Targets=HOG, Epochs=800, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 70 | |
| CMAE-VBackbone=ViT-B, Targets=Pixel, Epochs=800, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 69.7 | |
| VideoMAEBackbone=ViT-B, Targets=Pixel, Epochs=800, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 69.6 | |
| VideoMAEBackbone=ViT-B, Targets=Pixel, Epochs=1600, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 69.6 | |
| VideoSwinBackbone=Swin-B, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 69.6 | |
| OmniMAEBackbone=ViT-B, Targets=Pixel, Epochs=800, Pre-training Dataset=SSv2, Evaluation Protocol=Full finetuning2026.03 | 69.5 | |
| OmniMAEBackbone=ViT-B, Targets=Pixel, Epochs=800, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 69 | |
| OmniMAEBackbone=ViT-B, Targets=Pixel, Evaluation protocol=Full finetuning, Pre-training dataset=K4002026.03 | 69 | |
| MGMAEBackbone=ViT-B, Targets=Pixel, Epochs=800, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 68.9 | |
| MGMAEBackbone=ViT-B, Targets=Pixel, Evaluation protocol=Full finetuning, Pre-training dataset=K4002026.03 | 68.9 | |
| VideoMAEBackbone=ViT-B, Targets=Pixel, Epochs=800, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 68.5 | |
| VideoMAEBackbone=ViT-B, Targets=Pixel, Evaluation protocol=Full finetuning, Pre-training dataset=K4002026.03 | 68.5 | |
| MViTv1Backbone=MViTv1-B, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 67.7 | |
| MformerBackbone=Mformer-B, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 66.7 | |
| TimeSformerBackbone=ViT-B, Pre-training Dataset=K400, Evaluation Protocol=Full finetuning2026.03 | 59.5 |