Video Recognition on Kinetics (val)
81.5Top-1 AccuracyEnsemble
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| EnsembleModality=RGB + Flow + Audio2017.08 | 81.5 | 95.6 | — | |
| Shifting Attention NetworkModality=RGB + Flow + Audio2017.08 | 77.7 | 93.2 | — | |
| 3-stream SATTbackbone=Inception-ResNet-v2, modality=RGB + flow + audio2017.11 | 77.7 | 93.2 | — | |
| NL I3Dbackbone=ResNet-101, modality=RGB2017.11 | 77.7 | 93.3 | — | |
| NL I3DInput=RGB2019.05 | 77.7 | 93.3 | — | |
| 3 stream SATTInput=RGB+flow+audio2019.05 | 77.7 | 93.2 | — | |
| Temporal Xception NetworkModality=RGB + Flow + Audio2017.08 | 77.2 | 93.4 | — | |
| Fast-forward LSTMModality=RGB + Flow + Audio2017.08 | 77.1 | 93.2 | — | |
| 3-stream LSTMbackbone=Inception-ResNet-v2, modality=RGB + flow + audio2017.11 | 77.1 | 93.2 | — | |
| Multi-stream Sequence ModelModality=RGB + Flow + Audio2017.08 | 77 | 93.2 | — | |
| Semi-weakly supervisedModel=R(2+1)D-18, Clip length=32, # parameters=33M, FLOPS=83B, Input=RGB2019.05 | 76.7 | 92.3 | — | |
| NL I3Dbackbone=ResNet-50, modality=RGB2017.11 | 76.5 | 92.6 | — | |
| Weakly-supervisedModel=R(2+1)D-18, Clip length=32, # parameters=33M, FLOPS=83B, Input=RGB2019.05 | 76 | 92 | — | |
| Semi-weakly supervisedModel=R(2+1)D-34, Clip length=8, # parameters=64M, FLOPS=38B, Input=RGB2019.05 | 75.9 | 92 | — | |
| 2-Stream I3Dbackbone=Inception, modality=RGB + flow2017.11 | 75.7 | 92 | — | |
| I3D-Two-StreamInput=RGB+flow2019.05 | 75.7 | 92 | — | |
| CPNetparams (M)=42.1, Clip length=32 frames, Backbone=C2D ResNet-1012019.05 | 75.3 | 92.4 | — | |
| NL C2D ResNet-101params (M)=48.2, Clip length=32 frames, Backbone=ResNet-1012019.05 | 75.1 | 91.7 | — | |
| Late fusionModality=RGB + Flow + Audio2017.08 | 74.9 | 91.6 | — | |
| 3-stream late fusionbackbone=Inception-ResNet-v2, modality=RGB + flow + audio2017.11 | 74.9 | 91.6 | — | |
| Weakly-supervisedModel=R(2+1)D-34, Clip length=8, # parameters=64M, FLOPS=38B, Input=RGB2019.05 | 74.8 | 91.2 | — | |
| TSM_16FFLOPs=65G, Param.=24.3M, Latency=29.0ms, Thrput.=39.5V/s2018.11 | 74.7 | — | — | |
| Semi-weakly supervisedModel=R(2+1)D-18, Clip length=8, # parameters=33M, FLOPS=21B, Input=RGB2019.05 | 74.2 | 91.3 | — | |
| TSM_8FFLOPs=33G, Param.=24.3M, Latency=17.4ms, Thrput.=77.4V/s2018.11 | 74.1 | — | — | |
| I3DFLOPs=33G, Param.=29.3M, Latency=25.8ms, Thrput.=42.4V/s2018.11 | 73.3 | — | — | |
| Inception-ResNet-v2Modality=RGB2017.08 | 73 | 90.9 | — | |
| RGB baselinebackbone=Inception-ResNet-v2, modality=RGB2017.11 | 73 | 90.9 | — | |
| Inception-ResNet-v2params (M)=50.92019.05 | 73 | 90.9 | — | |
| I3Dbackbone=Inception, modality=RGB2017.11 | 72.1 | 90.3 | — | |
| I3D Inceptionparams (M)=25.02019.05 | 72.1 | 90.3 | — | |
| Weakly-supervisedModel=R(2+1)D-18, Clip length=8, # parameters=33M, FLOPS=21B, Input=RGB2019.05 | 71.5 | 89.7 | — | |
| Fully-supervisedModel=R(2+1)D-18, Clip length=32, # parameters=33M, FLOPS=83B, Input=RGB2019.05 | 69.3 | 87.7 | — | |
| Fully-supervisedModel=R(2+1)D-34, Clip length=8, # parameters=64M, FLOPS=38B, Input=RGB2019.05 | 67 | 85.8 | — | |
| Fully-supervisedModel=R(2+1)D-18, Clip length=8, # parameters=33M, FLOPS=21B, Input=RGB2019.05 | 64.8 | 84.5 | — | |
| Inception-ResNet-v2Modality=Flow2017.08 | 54.5 | 75.9 | — | |
| VGG16Modality=Audio2017.08 | 21.6 | 39.4 | — | |
| ARTNet w/o TSNSpatial resolution=112 × 112, Backbone architecture=ResNet-182017.11 | — | — | 78.7 | |
| ARTNet with TSNSpatial resolution=112 × 112, Backbone architecture=ResNet-182017.11 | — | — | 80 | |
| C3DSpatial resolution=112 × 112, Backbone architecture=ResNet-182017.11 | — | — | 75.7 | |
| C3DSpatial resolution=112 × 112, Backbone architecture=ResNet-342017.11 | — | — | 77 | |
| TSN Spatial NetworksSpatial resolution=224 × 224, Backbone architecture=Inception V22017.11 | — | — | 77.8 |