Classification of Procedural Activities on COIN (test)
90.81AccuracyS5 + LSMCL
Evaluation Results
| Method | Links | |
|---|---|---|
| S5 + LSMCLP.T. Dataset=Kinetics-600, P.T. Samples=495K2023.03 | 90.81 | |
| ProcedureVRLPretraining Supervision=Unsupervised: ASR, Pretraining Dataset=HT100M, Fine-tuned on COIN=false2023.03 | 90.8 | |
| S5P.T. Dataset=Kinetics-600, P.T. Samples=495K2023.03 | 90.42 | |
| Transformer w/ KB TransferLong-term Model=Transformer w/ KB Transfer, Segment Model=TimeSformer, Pretraining Supervision=Unsupervised: distant supervision, Pretraining Dataset=HT100M, finetuned=false2022.01 | 90 | |
| D-Sprv.P.T. Dataset=HowTo100M, P.T. Samples=136M2023.03 | 90 | |
| Basic Transformer (Distant Supervision)Long-term Model=Basic Transformer, Segment Model=TimeSformer, Pretraining Supervision=Unsupervised: distant supervision, Pretraining Dataset=HT100M, finetuned=false2022.01 | 88.9 | |
| DistantSupPretraining Supervision=Unsupervised: ASR + wikiHow, Pretraining Dataset=HT100M, Fine-tuned on COIN=false2023.03 | 88.9 | |
| ViS4merP.T. Dataset=Kinetics-600, P.T. Samples=495K2023.03 | 88.41 | |
| Basic TransformerLong-term Model=Basic Transformer, Segment Model=TimeSformer, Pretraining Supervision=Unsupervised: k-means on ASR, Pretraining Dataset=HT100M, finetuned=false2022.01 | 85.3 | |
| TimeSformerPretraining Supervision=Unsupervised: ASR w. MIL-NCE [39], Pretraining Dataset=HT100M, Fine-tuned on COIN=false2023.03 | 85.3 | |
| Basic TransformerLong-term Model=Basic Transformer, Segment Model=TimeSformer, Pretraining Supervision=Supervised: action labels, Pretraining Dataset=Kinetics, finetuned=false2022.01 | 83.5 | |
| TimeSformerPretraining Supervision=Supervised: action labels, Pretraining Dataset=Kinetics, Fine-tuned on COIN=false2023.03 | 83.5 | |
| TSN (RGB+Flow)Long-term Model=TSN (RGB+Flow), Segment Model=Inception, Pretraining Supervision=Supervised: action labels, Pretraining Dataset=Kinetics, finetuned=true2022.01 | 73.4 | |
| TSNP.T. Dataset=Kinetics-400, P.T. Samples=306K2023.03 | 73.4 | |
| TSN (RGB+Flow)Pretraining Supervision=Supervised: action labels, Pretraining Dataset=Kinetics, Fine-tuned on COIN=true2023.03 | 73.4 | |
| Basic TransformerLong-term Model=Basic Transformer, Segment Model=VideoCLIP, Pretraining Supervision=Unsupervised: NCE on ASR, Pretraining Dataset=HT100M, finetuned=false2022.01 | 72.5 | |
| VideoCLIPPretraining Supervision=Unsupervised: ASR, Pretraining Dataset=HT100M, Fine-tuned on COIN=false2023.03 | 72.5 | |
| Basic TransformerLong-term Model=Basic Transformer, Segment Model=SlowFast, Pretraining Supervision=Supervised: action labels, Pretraining Dataset=Kinetics, finetuned=false2022.01 | 71.6 | |
| SlowFastPretraining Supervision=Supervised: action labels, Pretraining Dataset=Kinetics, Fine-tuned on COIN=false2023.03 | 71.6 | |
| Basic TransformerLong-term Model=Basic Transformer, Segment Model=S3D, Pretraining Supervision=Unsupervised: MIL-NCE on ASR, Pretraining Dataset=HT100M, finetuned=true2022.01 | 70.2 | |
| S3DPretraining Supervision=Unsupervised: ASR w. MIL-NCE [39], Pretraining Dataset=HT100M, Fine-tuned on COIN=true2023.03 | 70.2 | |
| Basic TransformerLong-term Model=Basic Transformer, Segment Model=ClipBERT, Pretraining Supervision=Supervised: captions, Pretraining Dataset=COCO + Visual Genome, finetuned=false2022.01 | 65.4 | |
| ClipBERTPretraining Supervision=Supervised: captions, Pretraining Dataset=COCO+VG, Fine-tuned on COIN=false2023.03 | 65.4 |