Video Classification Robustness on Kinetics-400 v1 (val)
54.45Accuracy (Gaussian Noise)VITTA
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| VITTABackbone=Video Swin Transformer, Batch size=82022.11 | 54.45 | 51.17 | 44.15 | 67.92 | 51.99 | 55.92 | 57.57 | 60.97 | 67.68 | 54.47 | 65.97 | 22.34 | 54.55 | |
| TENTBackbone=Video Swin Transformer, Batch size=82022.11 | 43.94 | 35.59 | 26.38 | 65.9 | 43.67 | 45.76 | 58.6 | 59.65 | 66.64 | 50.04 | 56.94 | 20.94 | 47.84 | |
| SHOTBackbone=Video Swin Transformer, Batch size=82022.11 | 43.73 | 36.15 | 29.38 | 66.26 | 43.02 | 45.27 | 58.42 | 59.86 | 67 | 46.08 | 58.2 | 22.39 | 47.98 | |
| T3ABackbone=Video Swin Transformer, Batch size=82022.11 | 43.55 | 36.49 | 29.25 | 65.73 | 43.93 | 45.04 | 58.55 | 59.78 | 66.96 | 47.43 | 59.17 | 22.51 | 48.2 | |
| Source-OnlyBackbone=Video Swin Transformer, Batch size=82022.11 | 42.91 | 35.52 | 28.64 | 65.37 | 42.15 | 44.43 | 57.56 | 58.92 | 66.09 | 45.84 | 57.12 | 21.56 | 47.17 |