Temporal Action Localization on THUMOS14 (test)
78.2AP @ IoU=0.5ActionVLM-B-3B
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ActionVLM-B-3BVision Backbone=VM2-B, Language Model=QW2.5-3B, Encoder Scale=large, Feature Extraction Regime=end2end2026.01 | 78.2 | — | — | 88.8 | 85.1 | 67.1 | 51.8 | — | — | 74.2 | — | — | — | |
| ActionVLM-3BVision Backbone=TSP/VM2-g, Language Model=QW2.5-3B, Feature Extraction Regime=pre-extracted2026.01 | 77.4 | — | — | 87.7 | 83.4 | 65.2 | 50.9 | — | — | 72.9 | — | — | — | |
| ActionVLM-B-1.5BVision Backbone=VM2-B, Language Model=QW2.5-1.5B, Encoder Scale=large, Feature Extraction Regime=end2end2026.01 | 77.4 | — | — | 88.1 | 84.5 | 66.9 | 51.5 | — | — | 73.7 | — | — | — | |
| ActionVLM-1.5BVision Backbone=TSP/VM2-g, Language Model=QW2.5-1.5B, Feature Extraction Regime=pre-extracted2026.01 | 76.9 | — | — | 87.3 | 82.6 | 64.9 | 50.7 | — | — | 72.5 | — | — | — | |
| ADI-DiffVision Backbone=R(2+1)D/I3D, Feature Extraction Regime=pre-extracted2026.01 | 76.5 | — | — | 84.9 | 81.5 | 63 | 48 | — | — | 70.8 | — | — | — | |
| DyFADetVision Backbone=TSP/VM2-g, Feature Extraction Regime=pre-extracted2026.01 | 76.3 | — | — | 86 | 81.7 | 64.5 | 50.1 | — | — | 71.7 | — | — | — | |
| ActionVLM-S-3BVision Backbone=VM2-S, Language Model=QW2.5-3B, Encoder Scale=small, Feature Extraction Regime=end2end2026.01 | 75.8 | — | — | 87.2 | 82.9 | 64.6 | 49.6 | — | — | 72 | — | — | — | |
| AdaTADVision Backbone=VM-S, Encoder Scale=large, Feature Extraction Regime=end2end2026.01 | 75.3 | — | — | 87 | 82.4 | 63.8 | 49.2 | — | — | 71.5 | — | — | — | |
| ActionVLM-S-1.5BVision Backbone=VM2-S, Language Model=QW2.5-1.5B, Encoder Scale=small, Feature Extraction Regime=end2end2026.01 | 75 | — | — | 86.6 | 82.3 | 63.9 | 49 | — | — | 71.4 | — | — | — | |
| Re2TALVision Backbone=Re2SF-101, Encoder Scale=large, Feature Extraction Regime=end2end2026.01 | 74.3 | — | — | 84.2 | 80.3 | 62.7 | 49.6 | — | — | 70.2 | — | — | — | |
| ViT-TADVision Backbone=VM2-B, Encoder Scale=large, Feature Extraction Regime=end2end2026.01 | 74.2 | — | — | 85.1 | 80.9 | 61.8 | 45.4 | — | — | 69.5 | — | — | — | |
| TriDetBackbone=Fused2023.09 | 73.9 | — | — | 85.5 | 80.7 | 62.9 | 48.9 | — | — | 70.4 | — | — | — | |
| MFAMVision Backbone=I3D/VM2-g, Feature Extraction Regime=pre-extracted2026.01 | 73.5 | — | — | 84.6 | 80.8 | 61.7 | 48.6 | — | — | 69.8 | — | — | — | |
| ASLVision Backbone=TSP/I3D, Feature Extraction Regime=pre-extracted2026.01 | 73.4 | — | — | 85.3 | 80.9 | 61.1 | 45.1 | — | — | 69.2 | — | — | — | |
| TriDetBackbone=VideoMAEv22023.09 | 73.3 | — | — | 84.8 | 80 | 63.8 | 48.8 | — | — | 70.1 | — | — | — | |
| TriDetVision Backbone=TSP/VM2-g, Feature Extraction Regime=pre-extracted2026.01 | 73.3 | — | — | 84.8 | — | — | 48.8 | — | — | 70.1 | — | — | — | |
| ActionFormer*Backbone=VideoMAEv22023.09 | 73 | — | — | 84 | 79.6 | 63.5 | 47.7 | — | — | 69.6 | — | — | — | |
| ActionFormerVision Backbone=TSP/VM2-g, Feature Extraction Regime=pre-extracted2026.01 | 73 | — | — | 84 | — | — | 47.7 | — | — | 69.6 | — | — | — | |
| TriDetBackbone=I3D2023.09 | 72.9 | — | — | 83.6 | 80.1 | 62.4 | 47.4 | — | — | 69.3 | — | — | — | |
| Pred-DETRVision Backbone=I3D/I3D, Feature Extraction Regime=pre-extracted2026.01 | 72.2 | — | — | 84.1 | 80 | 60.4 | 45.8 | — | — | 68.5 | — | — | — | |
| DiGITVision Backbone=R(2+1)D/I3D, Feature Extraction Regime=pre-extracted2026.01 | 71.9 | — | — | 83.6 | 79.6 | 61.5 | 48.6 | — | — | 69 | — | — | — | |
| AdaTADVision Backbone=VM-S, Encoder Scale=small, Feature Extraction Regime=end2end2026.01 | 71.6 | — | — | 84.5 | 80.2 | 60.9 | 46.9 | — | — | 68.8 | — | — | — | |
| ActionFormerBackbone=I3D2023.09 | 71 | — | — | 82.1 | 77.8 | 59.4 | 43.9 | — | — | 66.8 | — | — | — | |
| ViT-TADVision Backbone=VM2-S, Encoder Scale=small, Feature Extraction Regime=end2end2026.01 | 69.4 | — | — | 79.8 | 75.2 | 56.4 | 41.7 | — | — | 64.3 | — | — | — | |
| DenoiseLocdenoising_training=true2023.04 | 64.26 | — | — | 76.65 | 72.06 | 51.23 | 39.54 | — | — | — | — | — | — | |
| TALLFormer2023.04 | 63.2 | — | — | 76 | — | — | 34.5 | — | — | — | — | — | — | |
| TALLFormerBackbone=Swin2023.09 | 63.2 | — | — | 76 | — | — | 34.5 | — | — | 59.2 | — | — | — | |
| DenoiseLocdenoising_training=false2023.04 | 62.62 | — | — | 75.64 | 70.42 | 51.36 | 38.58 | — | — | — | — | — | — | |
| TadTRBackbone=I3D2023.09 | 60.1 | — | — | 74.8 | 69.1 | 46.6 | 32.8 | — | — | 56.7 | — | — | — | |
| Re2TALVision Backbone=Re2Swin-T, Encoder Scale=small, Feature Extraction Regime=end2end2026.01 | 60.1 | — | — | 82.1 | 78.1 | 59.8 | 44.4 | — | — | 66.9 | — | — | — | |
| DaoTAD2023.04 | 59.8 | — | — | 72.7 | — | — | 33.3 | — | — | — | — | — | — | |
| ReActBackbone=TSN2023.09 | 57.1 | — | — | 69.2 | 65 | 47.8 | 35.6 | — | — | 55 | — | — | — | |
| E2E-TAL2023.04 | 56 | — | — | 69.4 | 64.3 | 46.4 | 34.9 | — | — | — | — | — | — | |
| AFSD2023.04 | 55.5 | — | — | 67.3 | 62.4 | 43.7 | 31.1 | — | — | — | — | — | — | |
| AFSDBackbone=I3D2023.09 | 55.5 | — | — | 67.3 | 62.4 | 43.7 | 31.1 | — | — | 52 | — | — | — | |
| ContextLocBackbone=I3D2023.09 | 54.3 | — | — | 68.3 | 63.8 | 41.8 | 26.2 | — | — | 50.9 | — | — | — | |
| TSPAlgorithm=P-GCN2020.11 | 53.5 | — | — | 69.1 | 63.3 | 40.4 | 26 | — | — | — | — | — | — | |
| TSPbase_algorithm=P-GCN2020.11 | 53.5 | 74 | 72.3 | 69.1 | 63.3 | 40.4 | 26 | 10.5 | 1.7 | — | — | — | — | |
| TriDetBackbone=DINOv22023.09 | 53.2 | — | — | 67.9 | 62.2 | 41.8 | 27.7 | — | — | 50.6 | — | — | — | |
| TSA-Net2020.11 | 53 | — | — | 65.6 | 61.4 | 42.4 | 28.8 | — | — | — | — | — | — | |
| TSA-Net2020.11 | 53 | — | — | 65.6 | 61.4 | 42.4 | 28.8 | — | — | — | — | — | — | |
| RCLmode=Pre-extracted features2022.03 | 52.9 | — | — | 70.1 | 62.3 | 42.7 | 30.7 | — | — | — | — | — | 57.1 | |
| VSGNmode=Pre-extracted features2022.03 | 52.4 | — | — | 66.7 | 60.4 | 41 | 30.4 | — | — | — | — | — | 56.6 | |
| VSGN2023.04 | 52.4 | — | — | 66.7 | 60.4 | 41 | 30.4 | — | — | — | — | — | — | |
| VSGNBackbone=TSN2023.09 | 52.4 | — | — | 66.7 | 60.4 | 41 | 30.4 | — | — | 50.2 | — | — | — | |
| C-TCN2020.11 | 52.1 | 72.2 | 71.4 | 68 | 62.3 | — | — | — | — | — | — | — | — | |
| RTD-NetBackbone=I3D2023.09 | 51.9 | — | — | 68.3 | 62.3 | 38.8 | 23.7 | — | — | 49 | — | — | — | |
| G-TADSupervision=Full2020.06 | 51.6 | — | — | 66.4 | 60.4 | 37.6 | 22.9 | — | — | — | — | — | — | |
| PBRNetmode=End-to-end learned/finetuned2022.03 | 51.3 | — | — | 58.5 | 54.6 | 41.8 | 29.5 | — | — | — | — | — | — | |
| PBRNet2020.11 | 51.3 | — | — | 58.5 | 54.6 | 41.8 | 29.5 | — | — | — | — | — | — | |
| PBRNet2020.11 | 51.3 | — | — | 58.5 | 54.6 | 41.8 | 29.5 | — | — | — | — | — | — | |
| AGT2021.01 | 50.2 | 72.1 | 69.8 | 65 | 58.1 | — | — | — | — | — | — | — | — | |
| P-GCN2019.09 | 49.1 | 69.5 | 67.8 | 63.6 | 57.8 | — | — | — | — | — | — | — | — | |
| P-GCNSupervision=Full, Feature=-2020.03 | 49.1 | 69.5 | 67.8 | 63.6 | 57.8 | — | — | — | — | — | — | — | — | |
| P-GCNSupervision=Full2020.03 | 49.1 | 69.5 | 67.8 | 63.6 | 57.8 | — | — | — | — | 61.6 | — | — | — | |
| P-GCNSupervision=Full2020.06 | 49.1 | 69.5 | 67.8 | 63.6 | 57.8 | — | — | — | — | — | — | — | — | |
| Zeng et al.2021.01 | 49.1 | 69.5 | 67.8 | 63.6 | 57.8 | — | — | — | — | — | — | — | — | |
| P-GCNSupervision=Fully2021.07 | 49.1 | 69.5 | 67.5 | 63.6 | 57.8 | — | — | — | — | 61.5 | — | — | — | |
| P-GCNmode=Pre-extracted features2022.03 | 49.1 | — | — | 63.6 | 57.8 | — | — | — | — | — | — | — | — | |
| P-GCN2020.11 | 49.1 | — | — | 63.6 | 57.8 | — | — | — | — | — | — | — | — | |
| P-GCN2020.11 | 49.1 | 69.5 | 67.8 | 63.6 | 57.8 | — | — | — | — | — | — | — | — | |
| A2NetBackbone=I3D2023.09 | 45.5 | — | — | 58.6 | 54.1 | 32.5 | 17.2 | — | — | 41.6 | — | — | — | |
| LC&LCmode=Pre-extracted features2022.03 | 45.4 | — | — | 53.9 | 50.7 | 38 | 28.5 | — | — | — | — | — | 49.1 | |
| Zhao et al.2020.11 | 45.4 | — | — | 53.9 | 50.7 | 38 | 28.5 | — | — | — | — | — | — | |
| Zhao et al.2020.11 | 45.4 | — | — | 53.9 | 50.7 | 38 | 28.5 | — | — | — | — | — | — | |
| TCANetBackbone=TSN2023.09 | 44.6 | — | — | 60.6 | 53.2 | 36.8 | 26.7 | — | — | 44.3 | — | — | — | |
| G-TAD2023.04 | 43 | — | — | 57.3 | 51.3 | 32.6 | 22.8 | — | — | — | — | — | — | |
| TAL-Net2019.09 | 42.8 | 59.8 | 57.1 | 53.2 | 48.5 | — | — | — | — | — | — | — | — | |
| TAL-NetSupervision=Strong2019.08 | 42.8 | 59.8 | 57.1 | 53.2 | 48.5 | — | 20.8 | — | — | — | — | — | — | |
| Chao et al.Supervision=Full, Feature=-2020.03 | 42.8 | 59.8 | 57.1 | 53.2 | 48.5 | 33.8 | 20.8 | — | — | — | — | — | — | |
| TAL-NetSupervision=Full2020.07 | 42.8 | 59.8 | 57.1 | 53.2 | 48.5 | 33.8 | 20.8 | — | — | — | — | — | — | |
| Faster-Supervision=Full2020.03 | 42.8 | 59.8 | 57.1 | 53.2 | 48.5 | 33.8 | 20.8 | — | — | 52.3 | — | — | — | |
| TAL-NetSupervision=Full2020.06 | 42.8 | 59.8 | 57.1 | 53.2 | 48.5 | 33.8 | 20.8 | — | — | 45.1 | — | — | — | |
| Chao et al.2021.01 | 42.8 | 59.8 | 57.1 | 53.2 | 48.5 | — | — | — | — | — | — | — | — | |
| TAL-NetSupervision=Fully2021.07 | 42.8 | 59.8 | 57.1 | 53.2 | 48.5 | 33.8 | 20.8 | — | — | 52.3 | 45.1 | — | — | |
| TAL-Netmode=Pre-extracted features2022.03 | 42.8 | — | — | 53.2 | 48.5 | 33.8 | 20.8 | — | — | — | — | — | — | |
| TAL-Net2020.11 | 42.8 | — | — | 53.2 | 48.5 | 33.8 | 20.8 | — | — | — | — | — | — | |
| TAL-Net2020.11 | 42.8 | 59.8 | 57.1 | 53.2 | 48.5 | 33.8 | 20.8 | — | — | — | — | — | — | |
| TAL-NetSupervision Type=Fully-supervised2020.10 | 42.8 | 59.8 | 57.1 | 53.2 | 48.5 | 33.8 | 20.8 | — | — | — | — | — | — | |
| PBRNetmode=Pre-extracted features, feature_adaptation=3D convolutions replaced with 1D convolutions2022.03 | 42.3 | — | — | 54.8 | 49.2 | 33.1 | 23 | — | — | — | — | — | 43.6 | |
| BC-GNNmode=Pre-extracted features2022.03 | 40.4 | — | — | 57.1 | 49.1 | 31.2 | 23.1 | — | — | — | — | — | — | |
| G-TADBackbone=TSN2023.09 | 40.3 | — | — | 54.5 | 47.6 | 30.8 | 23.4 | — | — | 39.3 | — | — | — | |
| Xu et al. [62]2021.01 | 40.2 | 66.1 | 64.2 | 54.5 | 47.6 | — | — | — | — | — | — | — | — | |
| G-TADSupervision level=Full, Feature Backbone=I3D2021.03 | 40.2 | — | — | 54.5 | 47.6 | 30.8 | 23.4 | — | — | 39.3 | — | — | — | |
| G-TADmode=Pre-extracted features2022.03 | 40.2 | — | — | 54.5 | 47.6 | 30.8 | 23.4 | — | — | — | — | — | 44.2 | |
| G-TAD2020.11 | 40.2 | — | — | 54.5 | 47.6 | 30.8 | 23.4 | — | — | — | — | — | — | |
| G-TAD2020.11 | 40.2 | — | — | 54.5 | 47.6 | 30.8 | 23.4 | — | — | — | — | — | — | |
| CMS-RC3D2020.11 | 40 | 61.6 | 59.3 | 54.7 | 48.2 | — | — | — | — | — | — | — | — | |
| DBGmode=Pre-extracted features2022.03 | 39.8 | — | — | 57.8 | 49.4 | 30.2 | 21.7 | — | — | — | — | — | — | |
| DBG2020.11 | 39.8 | — | — | 57.8 | 49.4 | 30.2 | 21.7 | — | — | — | — | — | — | |
| GTANSupervision=Full2020.07 | 38.8 | 69.1 | 63.7 | 57.8 | 47.2 | — | — | — | — | — | — | — | — | |
| BMNSupervision=Full2020.03 | 38.8 | — | — | 56 | 47.4 | 29.7 | 20.5 | — | — | — | — | — | — | |
| BMNmode=Pre-extracted features2022.03 | 38.8 | — | — | 56 | 47.4 | 29.7 | 20.5 | — | — | — | — | — | — | |
| BMN2023.04 | 38.8 | — | — | 56 | 47.4 | 29.7 | 20.5 | — | — | — | — | — | — | |
| BMNBackbone=TSN2023.09 | 38.8 | — | — | 56 | 47.4 | 29.7 | 20.5 | — | — | 38.5 | — | — | — | |
| GTAN2020.11 | 38.8 | — | — | 57.8 | 47.2 | — | — | — | — | — | — | — | — | |
| BMN2020.11 | 38.8 | — | — | 56 | 47.4 | 29.7 | 20.5 | — | — | — | — | — | — | |
| GTANSupervision Type=Fully-supervised2020.10 | 38.8 | 69.1 | 63.7 | 57.8 | 47.2 | — | — | — | — | — | — | — | — | |
| BMNSupervision Type=Fully-supervised2020.10 | 38.8 | — | — | 56 | 47.4 | 29.7 | 20.5 | — | — | — | — | — | — | |
| CO2-NetSupervision=Weakly2021.07 | 38.3 | 70.1 | 63.6 | 54.5 | 45.7 | 26.4 | 13.4 | 6.9 | 2 | 54.4 | 44.6 | 35.7 | — |