Temporal Action Localization on ActivityNet 1.3 (val)
59.3AP@0.5UnLoc-L
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| UnLoc-LSetting=Finetuned, Vision Encoder=CLIP, Mode=prompt ensembling2023.08 | 59.3 | — | — | — | — | — | — | |
| UnLoc-LSetting=Finetuned, Vision Encoder=CLIP, Mode=1st prompt2023.08 | 58.8 | — | — | — | — | — | — | |
| ActionVLM-3BVision Backbone=TSP/VM2-g, Language Model=QW2.5-3B, Feature Extraction Regime=pre-extracted2026.01 | 58.8 | 40 | 9.5 | 39.3 | — | — | — | |
| ActionVLM-B-3BVision Backbone=VM2-B, Language Model=QW2.5-3B, Encoder Scale=large, Feature Extraction Regime=end2end2026.01 | 58.8 | 40.6 | — | 39.7 | — | — | — | |
| ActionVLM-1.5BVision Backbone=TSP/VM2-g, Language Model=QW2.5-1.5B, Feature Extraction Regime=pre-extracted2026.01 | 58.6 | 39.7 | 9.3 | 39 | — | — | — | |
| Pred-DETRVision Backbone=I3D/I3D, Feature Extraction Regime=pre-extracted2026.01 | 58.4 | 39.1 | 9.9 | 38.6 | — | — | — | |
| ActionVLM-B-1.5BVision Backbone=VM2-B, Language Model=QW2.5-1.5B, Encoder Scale=large, Feature Extraction Regime=end2end2026.01 | 58.4 | 40.3 | 9.8 | 39.4 | — | — | — | |
| DyFADetVision Backbone=TSP/VM2-g, Feature Extraction Regime=pre-extracted2026.01 | 58.1 | 39.6 | 8.4 | 38.5 | — | — | — | |
| ActionVLM-S-3BVision Backbone=VM2-S, Language Model=QW2.5-3B, Encoder Scale=small, Feature Extraction Regime=end2end2026.01 | 58.1 | 40.2 | 9.6 | 39.2 | — | — | — | |
| ActionVLM-S-1.5BVision Backbone=VM2-S, Language Model=QW2.5-1.5B, Encoder Scale=small, Feature Extraction Regime=end2end2026.01 | 57.8 | 39.9 | 9.4 | 38.9 | — | — | — | |
| ADI-DiffVision Backbone=R(2+1)D/I3D, Feature Extraction Regime=pre-extracted2026.01 | 56.9 | 38.9 | 9.1 | 38.3 | — | — | — | |
| AdaTADVision Backbone=VM-S, Encoder Scale=large, Feature Extraction Regime=end2end2026.01 | 56.8 | 39.4 | 9.7 | 38.4 | — | — | — | |
| RefactorNetConference=CVPR 222022.06 | 56.6 | 40.7 | 7.4 | 38.6 | — | — | — | |
| STALESetting=Finetuned, Vision Encoder=I3D2023.08 | 56.5 | — | — | — | — | — | — | |
| AdaTADVision Backbone=VM-S, Encoder Scale=small, Feature Extraction Regime=end2end2026.01 | 56.2 | 39 | 9.1 | 37.8 | — | — | — | |
| ContextLocConference=ICCV'212022.06 | 56 | 35.2 | 3.6 | 34.2 | — | — | — | |
| ContextLocSetting=Finetuned, Vision Encoder=I3D2023.08 | 56 | — | — | — | — | — | — | |
| ContextLocFeature=I3D2023.05 | 56 | 35.2 | 3.6 | 34.2 | — | — | — | |
| ViT-TADVision Backbone=VM2-B, Encoder Scale=large, Feature Extraction Regime=end2end2026.01 | 55.9 | 38.5 | 8.8 | 37.4 | — | — | — | |
| Re2TALVision Backbone=Re2SF-101, Encoder Scale=large, Feature Extraction Regime=end2end2026.01 | 55.8 | 38.5 | 9.4 | 37.6 | — | — | — | |
| RCLFeature Backbone=TSP, Training Protocol=Pre-extracted features2022.03 | 55.15 | 39.02 | 827 | 37.65 | 21.1 | — | — | |
| ActionFormerVision Backbone=TSP/VM2-g, Feature Extraction Regime=pre-extracted2026.01 | 55.1 | 38.3 | 8.9 | 37.1 | — | — | — | |
| ViT-TADVision Backbone=VM2-S, Encoder Scale=small, Feature Extraction Regime=end2end2026.01 | 55.1 | 37.8 | 8.8 | 36.7 | — | — | — | |
| Re2TALVision Backbone=Re2Swin-T, Encoder Scale=small, Feature Extraction Regime=end2end2026.01 | 55.1 | 37.1 | 8.3 | 36.5 | — | — | — | |
| ActionFormerSetting=Finetuned, Vision Encoder=R(2+1)D2023.08 | 54.7 | — | — | — | — | — | — | |
| MFAMVision Backbone=I3D/VM2-g, Feature Extraction Regime=pre-extracted2026.01 | 54.7 | 37.3 | 8.6 | 36.6 | — | — | — | |
| TriDetVision Backbone=TSP/VM2-g, Feature Extraction Regime=pre-extracted2026.01 | 54.7 | 38 | 8.4 | 36.8 | — | — | — | |
| UnLoc-BSetting=Finetuned, Vision Encoder=CLIP, Mode=1st prompt2023.08 | 54.6 | — | — | — | — | — | — | |
| DiGITVision Backbone=R(2+1)D/I3D, Feature Extraction Regime=pre-extracted2026.01 | 54.4 | 38.2 | 10.7 | 37.3 | — | — | — | |
| TCANetConference=CVPR'212022.06 | 54.3 | 39.1 | 8.4 | 37.6 | — | — | — | |
| TCANetSetting=Finetuned, Vision Encoder=SlowFast2023.08 | 54.3 | — | — | — | — | — | — | |
| STALESetting=Finetuned, Vision Encoder=CLIP2023.08 | 54.3 | — | — | — | — | — | — | |
| ActionformerFeature=I3D2023.05 | 54.2 | 36.9 | 7.6 | 36 | — | — | — | |
| RCLFeature Backbone=TSN, Training Protocol=Pre-extracted features2022.03 | 54.19 | 36.19 | 917 | 35.98 | 20 | — | — | |
| ASLFeature=I3D2023.05 | 54.1 | 37.4 | 8 | 36.2 | — | — | — | |
| ASLVision Backbone=TSP/I3D, Feature Extraction Regime=pre-extracted2026.01 | 54.1 | 37.4 | 8 | 36.2 | — | — | — | |
| PBRNetSetting=Finetuned, Vision Encoder=I3D2023.08 | 54 | — | — | — | — | — | — | |
| PBRNetTraining Protocol=End-to-end learned/finetuned2022.03 | 53.96 | 34.97 | 898 | 35.01 | — | — | — | |
| TadTRSetting=Finetuned, Vision Encoder=R(2+1)D2023.08 | 53.6 | — | — | — | — | — | — | |
| VSGNSetting=Finetuned, Vision Encoder=I3D2023.08 | 53.3 | — | — | — | — | — | — | |
| VSGNFeature Backbone=TSP, Training Protocol=Pre-extracted features2022.03 | 53.26 | 36.76 | 812 | 35.94 | 20.9 | — | — | |
| GTAN2020.12 | 52.61 | 34.14 | 8.91 | 34.31 | — | — | — | |
| GTAN (2019)Supervision=Full2019.11 | 52.6 | 34.1 | 8.9 | 34.3 | — | — | — | |
| GTANSupervision=Fully supervised2022.03 | 52.6 | 34.1 | 8.9 | 34.3 | — | — | — | |
| GTANConference=CVPR'192022.06 | 52.6 | 34.1 | 8.9 | 34.3 | — | — | — | |
| GTANSupervision Level=Fully Supervised2023.04 | 52.6 | 34.1 | 8.9 | 34.3 | — | — | — | |
| GTANSetting=Finetuned, Vision Encoder=P3D2023.08 | 52.6 | — | — | — | — | — | — | |
| GTANFeature=P3D2023.05 | 52.6 | 34.1 | 8.9 | 34.3 | — | — | — | |
| BSN (2018)Supervision=Full2019.11 | 52.5 | 33.5 | 8.9 | 33.7 | — | — | — | |
| AFSDConference=CVPR'212022.06 | 52.4 | 35.3 | 6.5 | 34.4 | — | — | — | |
| VSGNConference=ICCV'212022.06 | 52.4 | 36 | 8.4 | 35.1 | — | — | — | |
| VSGNFeature=TSN2023.05 | 52.4 | 36 | 8.4 | 35.1 | — | — | — | |
| AFSDFeature=I3D2023.05 | 52.4 | 35.3 | 6.5 | 34.4 | — | — | — | |
| VSGNFeature Backbone=TSN, Training Protocol=Pre-extracted features2022.03 | 52.38 | 36.01 | 837 | 35.07 | 19.9 | — | — | |
| VSGNFeature Type=Pre-extracted TSN features2020.11 | 52.38 | 36.01 | 8.37 | 35.07 | 19.9 | — | — | |
| VSGNFeature Backbone=I3D, Training Protocol=Pre-extracted features2022.03 | 52.32 | 35.23 | 829 | 34.68 | 18.8 | — | — | |
| VSGNFeature Type=Pre-extracted I3D features2020.11 | 52.32 | 35.23 | 8.29 | 34.68 | 18.8 | — | — | |
| TCANetFeature=TSN2023.05 | 52.3 | 36.7 | 6.9 | 35.5 | — | — | — | |
| TCANetFeature Backbone=TSN, Training Protocol=Pre-extracted features2022.03 | 52.27 | 36.73 | 686 | 35.52 | — | — | — | |
| RCLFeature Backbone=I3D, Training Protocol=Pre-extracted features2022.03 | 51.74 | 35.27 | 803 | 34.39 | 18.5 | — | — | |
| PBRNet*Feature Backbone=TSN, Training Protocol=Pre-extracted features (1D Conv Adaptation)2022.03 | 51.41 | 34.35 | 866 | 33.9 | 18 | — | — | |
| PBRNet*Feature Backbone=I3D, Training Protocol=Pre-extracted features (1D Conv Adaptation)2022.03 | 51.32 | 33.33 | 709 | 33.08 | 17.6 | — | — | |
| TSPSetting=Finetuned, Vision Encoder=R(2+1)D2023.08 | 51.3 | — | — | — | — | — | — | |
| G-TADFeature Backbone=TSP, Training Protocol=Pre-extracted features2022.03 | 51.26 | 37.12 | 929 | 35.81 | 19.3 | — | — | |
| TSIFeature Type=Pre-extracted TSN features2020.11 | 51.18 | 35.02 | 6.59 | 34.15 | — | — | — | |
| SSN + GCMExternal video labels/scores=UntrimmedNet [41], Proposals=BMN prop [25]2021.12 | 51.03 | 35.17 | 7.44 | 34.24 | — | — | — | |
| G-TAD+BSPInput Modality=RGB-only, Pre-training=Kinetics, Backbone=TSM, Fine-tuned=false2020.11 | 50.94 | 35.61 | 7.98 | 34.75 | — | — | — | |
| G-TAD + LoFiOptical Flow=false, Architecture=ResNet-18, Number of Parameters=12M2021.03 | 50.68 | 35.16 | 8.16 | 34.49 | — | — | — | |
| BC-GNNConference=ECCV'202022.06 | 50.6 | 34.8 | 9.4 | 34.3 | — | — | — | |
| BC-GNN2020.11 | 50.56 | 34.75 | 9.37 | 34.26 | — | — | — | |
| BC-GNNOptical Flow=true, Architecture=ResNet-50, Number of Parameters=23M2021.03 | 50.56 | 34.75 | 9.37 | 34.26 | — | — | — | |
| BC-GNNFeature Backbone=TSN, Training Protocol=Pre-extracted features2022.03 | 50.56 | 34.75 | 937 | 34.26 | — | — | — | |
| BC-GNNFeature Type=Pre-extracted TSN features2020.11 | 50.56 | 34.75 | 9.37 | 34.26 | — | — | — | |
| G-TADSupervision=Full2020.06 | 50.4 | 34.6 | 9 | 34.1 | — | — | — | |
| G-TADConference=CVPR'202022.06 | 50.4 | 34.6 | 9 | 34.1 | — | — | — | |
| G-TADFeature=TSN2023.05 | 50.4 | 34.6 | 9 | 34.1 | — | — | — | |
| G-TAD2020.11 | 50.36 | 34.6 | 9.02 | 34.09 | — | — | — | |
| G-TADOptical Flow=true, Architecture=ResNet-50, Number of Parameters=23M2021.03 | 50.36 | 34.6 | 9.02 | 34.09 | — | — | — | |
| GTADExternal video labels/scores=UntrimmedNet [41]2021.12 | 50.36 | 34.6 | 9.02 | 34.09 | — | — | — | |
| G-TADFeature Backbone=TSN, Training Protocol=Pre-extracted features2022.03 | 50.36 | 34.6 | 902 | 34.09 | 17.5 | — | — | |
| G-TADFeature Type=Pre-extracted TSN features2020.11 | 50.36 | 34.6 | 9.02 | 34.09 | 17.5 | — | — | |
| BMNSupervision=Full2020.06 | 50.1 | 34.8 | 8.3 | 33.9 | — | — | — | |
| BMNConference=ICCV'192022.06 | 50.1 | 34.8 | 8.3 | 33.9 | — | — | — | |
| BMNFeature=TSN2023.05 | 50.1 | 34.8 | 8.3 | 33.9 | — | — | — | |
| BMN2020.11 | 50.07 | 34.78 | 8.29 | 33.85 | — | — | — | |
| BMN2020.12 | 50.07 | 34.78 | 8.29 | 33.85 | — | — | — | |
| BMNOptical Flow=true, Architecture=ResNet-50, Number of Parameters=23M2021.03 | 50.07 | 34.78 | 8.29 | 33.85 | — | — | — | |
| BMNExternal video labels/scores=UntrimmedNet [41]2021.12 | 50.07 | 34.78 | 8.29 | 33.85 | — | — | — | |
| BMNFeature Backbone=TSN, Training Protocol=Pre-extracted features2022.03 | 50.07 | 34.78 | 829 | 33.85 | 15.2 | — | — | |
| BMNFeature Type=Pre-extracted TSN features2020.11 | 50.07 | 34.78 | 8.29 | 33.85 | 15.2 | — | — | |
| Temporal Aggregation Modulebase_model=BMN2020.12 | 50.02 | 34.97 | 6.57 | 33.99 | — | — | — | |
| G-TADInput Modality=RGB-only, Pre-training=Kinetics, Backbone=TSM, Fine-tuned=false2020.11 | 50.01 | 35.07 | 8.02 | 34.26 | — | — | — | |
| MUSESConference=CVPR'212022.06 | 50 | 35 | 6.6 | 34 | — | — | — | |
| BMNre-implementation=true2020.12 | 49.66 | 33.85 | 7.86 | 33.45 | — | — | — | |
| G-TAD baseline*Optical Flow=false, Architecture=ResNet-18, Number of Parameters=12M, Pre-training=Kinetics400 RGB-only TSM, Fine-tuning=false2021.03 | 49.64 | 34.16 | 7.68 | 33.59 | — | — | — | |
| ReactFeature=I3D2023.05 | 49.6 | 33 | 8.6 | 32.6 | — | — | — | |
| TadTRFeature=I3D2023.05 | 49.1 | 32.6 | 8.5 | 32.3 | — | — | — | |
| SSAD (2017)Supervision=Full, ActivityNet Challenge Entry=true2019.11 | 49 | 32.9 | 7.9 | 32.3 | — | — | — | |
| P-GCNSupervision=Full2020.06 | 48.3 | 33.2 | 3.3 | 31.1 | — | — | — | |
| P-GCNFeature=I3D2023.05 | 48.3 | 33.2 | 3.3 | 31.1 | — | — | — |