Action Recognition on UAV Human (test)
55Top-1 AccuracyPMI Sampler
Evaluation Results
| Method | Links | |
|---|---|---|
| PMI SamplerFrames Number=16, Input Size=224 x 224, Init.=Kinetics2023.04 | 55 | |
| MG SamplerFrames Number=16, Input Size=224 x 224, Init.=Kinetics2023.04 | 53.8 | |
| PMI SamplerFrames Number=8, Input Size=620 x 620, Init.=Kinetics2023.04 | 52 | |
| MITFASBackbone=X3D-M, Frames Number=16, Input Size=224 x 224, Initialization=Kinetics2023.03 | 50.8 | |
| MITFASFrames Number=16, Input Size=224 x 224, Init.=Kinetics2023.04 | 50.8 | |
| PMI SamplerFrames Number=8, Input Size=540 x 540, Init.=Kinetics2023.04 | 47.7 | |
| AZTRFrames Number=16, Input Size=224 x 224, Init.=Kinetics2023.04 | 47.4 | |
| MITFASBackbone=X3D-M, Frames Number=8, Input Size=620 x 620, Initialization=Kinetics2023.03 | 46.6 | |
| MITFASFrames Number=8, Input Size=620 x 620, Init.=Kinetics2023.04 | 46.6 | |
| DiffFARFrames Number=8, Input Size=540 x 540, Init.=Kinetics2023.04 | 41.9 | |
| MITFASBackbone=X3D-M, Frames Number=16, Input Size=224 x 224, Initialization=None2023.03 | 40.2 | |
| PMI SamplerFrames Number=8, Input Size=540 x 540, Init.=None2023.04 | 39.7 | |
| FARBackbone=X3D-M, Frames Number=8, Input Size=620 x 620, Initialization=Kinetics2023.03 | 39.1 | |
| FARFrames Number=8, Input Size=620 x 620, Init.=Kinetics2023.04 | 39.1 | |
| X3D-M + FARParam (M)=3.8, FLOPs (GFlops/video)=14.41, GPU (GB/video)=3, Inference Time (sec/video)=0.092022.03 | 38.6 | |
| FARFrames Number=8, Input Size=540 x 540, Init.=Kinetics2023.04 | 38.6 | |
| MITFASBackbone=X3D-M, Frames Number=8, Input Size=540 x 540, Initialization=None2023.03 | 38.4 | |
| MITFASFrames Number=8, Input Size=540 x 540, Init.=None2023.04 | 38.4 | |
| X3D-MParam (M)=3.8, FLOPs (GFlops/video)=14.39, GPU (GB/video)=3, Inference Time (sec/video)=0.082022.03 | 36.6 | |
| X3D-MFrames Number=8, Input Size=540 x 540, Init.=Kinetics2023.04 | 36.6 | |
| ViT-B-TimeSformerParam (M)=121.4, FLOPs (GFlops/video)=2380, GPU (GB/video)=32, Inference Time (sec/video)=0.272022.03 | 33.9 | |
| FARBackbone=X3D-M, Frames Number=16, Input Size=224 x 224, Initialization=Kinetics2023.03 | 31.9 | |
| FARFrames Number=16, Input Size=224 x 224, Init.=Kinetics2023.04 | 31.9 | |
| X3D-MBackbone=-, Frames Number=16, Input Size=224 x 224, Initialization=Kinetics2023.03 | 30.6 | |
| X3D-MFrames Number=16, Input Size=224 x 224, Init.=Kinetics2023.04 | 30.6 | |
| I3D + FARParam (M)=12, FLOPs (GFlops/video)=346.6, GPU (GB/video)=10, Inference Time (sec/video)=0.22022.03 | 29.21 | |
| FARBackbone=I3D, Frames Number=8, Input Size=540 x 960, Initialization=Kinetics2023.03 | 29.2 | |
| FARBackbone=X3D-M, Frames Number=8, Input Size=540 x 540, Initialization=None2023.03 | 28.8 | |
| FARFrames Number=8, Input Size=540 x 540, Init.=None2023.04 | 28.8 | |
| X3D-LBackbone=-, Frames Number=16, Input Size=224 x 224, Initialization=None2023.03 | 27.6 | |
| FARBackbone=X3D-M, Frames Number=16, Input Size=224 x 224, Initialization=None2023.03 | 27.6 | |
| X3D-MBackbone=-, Frames Number=16, Input Size=224 x 224, Initialization=None2023.03 | 27 | |
| I3D + FNetParam (M)=12, FLOPs (GFlops/video)=346.56, GPU (GB/video)=10, Inference Time (sec/video)=0.12022.03 | 24.39 | |
| MVITParam (M)=36.6, FLOPs (GFlops/video)=70.8, GPU (GB/video)=9, Inference Time (sec/video)=0.162022.03 | 24.3 | |
| FNetBackbone=I3D, Frames Number=8, Input Size=540 x 960, Initialization=Kinetics2023.03 | 24.3 | |
| MVITBackbone=-, Frames Number=16, Input Size=224 x 224, Initialization=Kinetics2023.03 | 24.3 | |
| I3D + Fourier AttentionParam (M)=12, FLOPs (GFlops/video)=346.57, GPU (GB/video)=10, Inference Time (sec/video)=0.192022.03 | 24.15 | |
| I3D + Efficient AttentionParam (M)=12, FLOPs (GFlops/video)=462, GPU (GB/video)=13.3, Inference Time (sec/video)=0.122022.03 | 21.13 | |
| I3DBackbone=ResNet-101, Frames Number=8, Input Size=540 x 960, Initialization=Kinetics2023.03 | 21.1 | |
| I3D-MParam (M)=12, FLOPs (GFlops/video)=346.55, GPU (GB/video)=10, Inference Time (sec/video)=0.12022.03 | 21.06 |