Action Recognition on UCF101 (val)
97.3AccuracyClean
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CleanBackbone=Video Swin Transformer2022.11 | 97.3 | — | — | |
| CleanBackbone=TANet2022.11 | 96.67 | — | — | |
| VideoMAEBackbone=ViT-B, Number of Frames=16, Evaluation Protocol=fine-tuned2022.03 | 91.3 | — | — | |
| ViTTABackbone=Video Swin Transformer, Batch size=82022.11 | 84.74 | — | — | |
| ViTTABackbone=Video Swin Transformer, Batch size=12022.11 | 84.63 | — | — | |
| NORMBackbone=Video Swin Transformer, Batch size=82022.11 | 82.35 | — | — | |
| MoCo v3Backbone=ViT-B, Number of Frames=16, Evaluation Protocol=fine-tuned2022.03 | 81.7 | — | — | |
| TENTBackbone=Video Swin Transformer, Batch size=12022.11 | 81.19 | — | — | |
| SHOTBackbone=Video Swin Transformer, Batch size=82022.11 | 80.68 | — | — | |
| T3ABackbone=Video Swin Transformer, Batch size=82022.11 | 80.68 | — | — | |
| T3ABackbone=Video Swin Transformer, Batch size=12022.11 | 80.66 | — | — | |
| SourceBackbone=Video Swin Transformer2022.11 | 78.48 | — | — | |
| TENTBackbone=Video Swin Transformer, Batch size=82022.11 | 78.42 | — | — | |
| ViTTABackbone=TANet, Batch size=82022.11 | 78.33 | — | — | |
| ViTTABackbone=TANet, Batch size=12022.11 | 78.2 | — | — | |
| MAXIgt=no, language=K400 dict, GPT3 verbs, BLIP verbs, vis.encoder=ViT-B/16, frames=162023.03 | 78.2 | — | — | |
| MAXIgt=no, language=K400 dict, GPT3 verbs, BLIP verbs, vis.encoder=ViT-B/16, frames=16/322023.03 | 78.2 | — | — | |
| MAXIgt=no, language=K400 dict, GPT3 verbs, vis.encoder=ViT-B/16, frames=162023.03 | 77.8 | — | — | |
| MAXIgt=no, language=K400 dict, GPT3 verbs, vis.encoder=ViT-B/16, frames=16/322023.03 | 77.8 | — | — | |
| Reference Masking RegularizationBackbone=ViTb16, Pre-trained=ImageNet-1K, Adaptation Protocol=Linear Probing2024.06 | 77.01 | — | — | |
| ViFi-CLIPgt=yes, language=K400 dict., vis.encoder=ViT-B/16, frames=322023.03 | 76.8 | — | — | |
| MAXIgt=no, language=K400 dict., vis.encoder=ViT-B/16, frames=162023.03 | 76.6 | — | — | |
| StandardBackbone=ViTb16, Pre-trained=ImageNet-1K, Adaptation Protocol=Linear Probing2024.06 | 75.55 | — | — | |
| ViFi-CLIP (re-eval)gt=yes, language=K400 dict., vis.encoder=ViT-B/16, frames=162023.03 | 74.9 | — | — | |
| TENTBackbone=TANet, Batch size=82022.11 | 72.92 | — | — | |
| XCLIPgt=yes, language=K400 dict., vis.encoder=ViT-B/16, frames=322023.03 | 72 | — | — | |
| CLIPgt=no, vis.encoder=ViT-B/16, frames=162023.03 | 69.9 | — | — | |
| A5gt=yes, language=K400 dict., vis.encoder=ViT-B/16, frames=322023.03 | 69.3 | — | — | |
| SHOTBackbone=Video Swin Transformer, Batch size=12022.11 | 68.51 | — | — | |
| NORMBackbone=TANet, Batch size=82022.11 | 65.77 | — | — | |
| SHOTBackbone=TANet, Batch size=82022.11 | 65.54 | — | — | |
| ActionCLIPgt=yes, language=K400 dict., vis.encoder=ViT-B/16, frames=322023.03 | 58.3 | — | — | |
| JigsawNetgt=yes, language=Manual description, vis.encoder=R(2+1)D, frames=162023.03 | 56 | — | — | |
| DUABackbone=TANet, Batch size=12022.11 | 55.34 | — | — | |
| T3ABackbone=TANet, Batch size=12022.11 | 54.17 | — | — | |
| T3ABackbone=TANet, Batch size=82022.11 | 54.17 | — | — | |
| ER-ZSARgt=yes, language=Manual description, vis.encoder=TSM, frames=162023.03 | 51.8 | — | — | |
| NORMBackbone=TANet, Batch size=12022.11 | 51.59 | — | — | |
| TENTBackbone=TANet, Batch size=12022.11 | 51.58 | — | — | |
| from scratchBackbone=ViT-B, Number of Frames=16, Evaluation Protocol=supervised training2022.03 | 51.4 | — | — | |
| SourceBackbone=TANet2022.11 | 51.35 | — | — | |
| SHOTBackbone=TANet, Batch size=12022.11 | 51.2 | — | — | |
| Baseline (Naive + Var.)Data Type=3D Fractals2026.02 | — | 77.7 | 95.1 | |
| Data-Driven (RF-Filter)Data Type=3D Fractals2026.02 | — | 74.4 | 92.8 | |
| From ScratchData Type=N/A2026.02 | — | 70.3 | — | |
| Kinetics (Kay et al., 2017)Data Type=Natural images2026.02 | — | 95.3 | — | |
| SVD-Control FilterData Type=3D Fractals2026.02 | — | 75.7 | 94.3 | |
| Svyezhentsev et al. (2024)Data Type=2D Fractals2026.02 | — | 81.8 | — | |
| Targeted Smart Filtering (TSF)Data Type=3D Fractals2026.02 | — | 78.3 | 95.4 |