Video Summarization on TVSum
69F-MeasureCLIP-It
Evaluation Results
| Method | Links | |
|---|---|---|
| CLIP-ItData Configuration=Augment2021.07 | 69 | |
| CLIP-Image+TransformerData Configuration=Augment2021.07 | 68.1 | |
| ResNet+TransformerData Configuration=Augment2021.07 | 67.5 | |
| GoogleNet+TransformerData Configuration=Augment2021.07 | 66.3 | |
| CLIP-ItData Configuration=Standard2021.07 | 66.3 | |
| Park et al. (SumGraph)Data Configuration=Augment2021.07 | 65.8 | |
| CLIP-ItData Configuration=Augment, Backbone=CLIP-Image, Temporal Module=Transformer, Language Features=Video Caption2021.07 | 65.7 | |
| CLIP-Image+TransformerData Configuration=Standard2021.07 | 65.5 | |
| CLIP-ItData Configuration=Transfer2021.07 | 65.5 | |
| Semantic-Guided Unsupervised Video SummarizationLearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 65.3 | |
| ResNet+TransformerData Configuration=Standard2021.07 | 65 | |
| CLIP-Image+Video Caption+bi-LSTMData Configuration=Augment2021.07 | 64.3 | |
| GoogleNet+TransformerData Configuration=Standard2021.07 | 64.2 | |
| Unsupervised Tessellationmode=unsupervised2016.12 | 64.1 | |
| TessellationLearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 64.1 | |
| CLIP-Image+TransformerData Configuration=Augment, Backbone=CLIP-Image, Temporal Module=Transformer2021.07 | 64 | |
| Zhang et al. [44]Data Configuration=Augment2021.07 | 63.9 | |
| Park et al. (SumGraph)Data Configuration=Standard2021.07 | 63.9 | |
| re-S2SSetting=Augmented, Learning Paradigm=Supervised2022.01 | 63.9 | |
| DSNetSetting=Augmented, Learning Paradigm=Supervised2022.01 | 63.9 | |
| HumanEvaluation protocol=Canonical2018.12 | 63.7 | |
| CLIP-Image+bi-LSTMData Configuration=Augment2021.07 | 63.7 | |
| Supervised Tessellationmode=supervised2016.12 | 63.4 | |
| CLIP-Image+TransformerData Configuration=Transfer2021.07 | 63.4 | |
| ResNet+TransformerData Configuration=Augment, Backbone=ResNet, Temporal Module=Transformer2021.07 | 63 | |
| CLIP-ItData Configuration=Standard, Backbone=CLIP-Image, Temporal Module=Transformer, Language Features=Video Caption2021.07 | 63 | |
| PRLVSLearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 63 | |
| CLIP-ItData Configuration=Transfer, Backbone=CLIP-Image, Temporal Module=Transformer, Language Features=Video Caption2021.07 | 62.8 | |
| ResNet+TransformerData Configuration=Transfer2021.07 | 62.8 | |
| Fajtl et al.Data Configuration=Augment2021.07 | 62.4 | |
| CLIP-Image+Video Caption+bi-LSTMData Configuration=Transfer2021.07 | 62.4 | |
| VASNetEvaluation protocol=Augmented2018.12 | 62.37 | |
| GoogleNet+TransformerData Configuration=Augment, Backbone=GoogleNet, Temporal Module=Transformer2021.07 | 62.1 | |
| Chen et al. (V2TS)Data Configuration=Standard2021.07 | 62.1 | |
| DSNetSetting=Canonical, Learning Paradigm=Supervised2022.01 | 62.1 | |
| CLIP-Image+TransformerData Configuration=Standard, Backbone=CLIP-Image, Temporal Module=Transformer2021.07 | 61.9 | |
| H-RNNSetting=Augmented, Learning Paradigm=Supervised2022.01 | 61.9 | |
| M-AVSEvaluation protocol=Augmented2018.12 | 61.8 | |
| SSPVSSetting=Augmented, Learning Paradigm=Supervised2022.01 | 61.8 | |
| CLIP-Image+bi-LSTMData Configuration=Transfer2021.07 | 61.6 | |
| MSVASetting=Canonical, Learning Paradigm=Supervised2022.01 | 61.5 | |
| SUM-Ind_LULearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 61.5 | |
| VASNetEvaluation protocol=Canonical2018.12 | 61.42 | |
| Fajtl et al.Data Configuration=Standard2021.07 | 61.4 | |
| DSR-RL-LSTMLearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 61.4 | |
| GoogleNet+TransformerData Configuration=Transfer2021.07 | 61.3 | |
| SUM-GAN-GEALearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 61.3 | |
| GANsupEvaluation Protocol=Augmented2017.12 | 61.2 | |
| SUM-GANsupEvaluation protocol=Augmented2018.12 | 61.2 | |
| SumGraphData Configuration=Augment2021.07 | 61.2 | |
| Mahasseni et al. (SUM-GANsup)Data Configuration=Augment2021.07 | 61.2 | |
| SGANSSetting=Augmented, Learning Paradigm=Supervised2022.01 | 61.2 | |
| ResNet+TransformerData Configuration=Standard, Backbone=ResNet, Temporal Module=Transformer2021.07 | 61.1 | |
| RS-SUMLearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 61.1 | |
| M-AVSEvaluation protocol=Canonical2018.12 | 61 | |
| ResNet+bi-LSTMData Configuration=Augment2021.07 | 61 | |
| DMFFLearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 61 | |
| AMFMLearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 61 | |
| Local Tessellation2016.12 | 60.9 | |
| CLIP-Image+TransformerData Configuration=Transfer, Backbone=CLIP-Image, Temporal Module=Transformer2021.07 | 60.6 | |
| AC-SUM-GANLearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 60.6 | |
| Park et al. (SumGraph)Data Configuration=Transfer2021.07 | 60.5 | |
| SSPVS+TextSetting=Canonical, Learning Paradigm=Supervised2022.01 | 60.4 | |
| re-S2SSetting=Canonical, Learning Paradigm=Supervised2022.01 | 60.3 | |
| SSPVSSetting=Canonical, Learning Paradigm=Supervised2022.01 | 60.3 | |
| SSPVSLearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 60.3 | |
| DSR-RL-GRULearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 60.2 | |
| HMT2021.09 | 60.1 | |
| GoogleNet+TransformerData Configuration=Standard, Backbone=GoogleNet, Temporal Module=Transformer2021.07 | 59.9 | |
| ResNet+TransformerData Configuration=Transfer, Backbone=ResNet, Temporal Module=Transformer2021.07 | 59.9 | |
| ResNet+bi-LSTMData Configuration=Transfer2021.07 | 59.9 | |
| DR-DSNsupEvaluation Protocol=Augmented2017.12 | 59.8 | |
| DR-DSNsupEvaluation protocol=Augmented2018.12 | 59.8 | |
| Zhou et al.Data Configuration=Augment2021.07 | 59.8 | |
| HSASetting=Augmented, Learning Paradigm=Supervised2022.01 | 59.8 | |
| DPP-LSTMEvaluation Protocol=Augmented2017.12 | 59.6 | |
| dppLSTMEvaluation protocol=Augmented2018.12 | 59.6 | |
| Zhang et al. (LSTM)Data Configuration=Augment2021.07 | 59.6 | |
| GoogleNet+bi-LSTMData Configuration=Augment2021.07 | 59.6 | |
| CAANLearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 59.6 | |
| SUM-GDALearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 59.6 | |
| GANdppEvaluation Protocol=Augmented2017.12 | 59.5 | |
| Mahasseni et al.Data Configuration=Augment2021.07 | 59.5 | |
| CLIP-Image+Video Caption+bi-LSTMData Configuration=Augment, Backbone=CLIP-Image, Temporal Module=bi-LSTM, Language Features=Video Caption2021.07 | 59.4 | |
| He et al.Data Configuration=Standard2021.07 | 59.4 | |
| DSNetSetting=Transfer, Learning Paradigm=Supervised2022.01 | 59.4 | |
| SumGraphData Configuration=Standard2021.07 | 59.3 | |
| Rochan et al. (SUM-FCN)Data Configuration=Augment2021.07 | 59.2 | |
| S-FCNSetting=Augmented, Learning Paradigm=Supervised2022.01 | 59.2 | |
| Rochan et al. (SUM-DeepLab)Data Configuration=Augment2021.07 | 59.1 | |
| DR-DSNsupEvaluation Protocol=Transfer2017.12 | 58.9 | |
| He et al.Data Configuration=Augment2021.07 | 58.9 | |
| Zhou et al.Data Configuration=Transfer2021.07 | 58.9 | |
| SGANSetting=Augmented, Learning Paradigm=Unsupervised2022.01 | 58.9 | |
| ACGANSetting=Augmented, Learning Paradigm=Unsupervised2022.01 | 58.9 | |
| CSNetLearning mode=Unsupervised2018.11 | 58.8 | |
| CSNetLearning Supervision=Unsupervised, Evaluation Protocol=Multi-user annotations2026.01 | 58.8 | |
| DPP-LSTMEvaluation Protocol=Transfer2017.12 | 58.7 | |
| CLIP-Image+bi-LSTMData Configuration=Augment, Backbone=CLIP-Image, Temporal Module=bi-LSTM2021.07 | 58.7 | |
| Zhang et al. (LSTM)Data Configuration=Transfer2021.07 | 58.7 |