Action Recognition on Drive&Act
77.1Sym AccFrame2Freq-MS
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Frame2Freq-MSPretrain=DINOv2, Param (M)=7.3, Fine-tuning Protocol=PEFT2026.02 | 77.1 | 85.5 | — | 81.5 | |
| Frame2Freq-STPretrain=DINOv2, Param (M)=3.5, Fine-tuning Protocol=PEFT2026.02 | 76.9 | 86.8 | — | 82 | |
| Frame2Freq-STPretrain=CLIP, Param (M)=3.5, Fine-tuning Protocol=PEFT2026.02 | 75.5 | 86.9 | — | 81.4 | |
| STEPBackbone=DINOv2, GFLOPs=413.1, Train Params (M)=2.62025.03 | 69.98 | 84.02 | 78.4 | — | |
| M2-CLIPBackbone=DINOv2, GFLOPs=1128, Train Params (M)=14.82025.03 | 68.4 | 84.98 | 77.73 | — | |
| M2-CLIPPretrain=DINOv2, Param (M)=14.8, Fine-tuning Protocol=PEFT2026.02 | 68.4 | 85 | — | 77.7 | |
| M2-CLIPBackbone=CLIP, GFLOPs=935, Train Params (M)=14.82025.03 | 67.4 | 85.7 | 77.2 | — | |
| M2-CLIPPretrain=CLIP, Param (M)=14.8, Fine-tuning Protocol=PEFT2026.02 | 67.4 | 85.7 | — | 77.2 | |
| ST-AdaptorBackbone=DINOv2, GFLOPs=1099, Train Params (M)=7.12025.03 | 66.43 | 83.43 | 75.19 | — | |
| ST-AdapterPretrain=DINOv2, Param (M)=7.1, Fine-tuning Protocol=PEFT2026.02 | 66.4 | 83.4 | — | 75.2 | |
| VitaCLIPPretrain=CLIP, Param (M)=29.0, Fine-tuning Protocol=PEFT2026.02 | 65.5 | 81.9 | — | 73.9 | |
| VitaCLIPPretrain=DINOv2, Param (M)=29.0, Fine-tuning Protocol=PEFT2026.02 | 65.5 | 79.8 | — | 72.9 | |
| VitaCLIPBackbone=CLIP, GFLOPs=937, Train Params (M)=28.62025.03 | 65.45 | 81.85 | 73.98 | — | |
| VitaCLIPBackbone=DINOv2, GFLOPs=1130, Train Params (M)=28.62025.03 | 65.45 | 79.78 | 72.91 | — | |
| Frame2Freq-MSPretrain=CLIP, Param (M)=7.3, Fine-tuning Protocol=PEFT2026.02 | 64.4 | 88.6 | — | 77.4 | |
| Self-Attn ProbingBackbone=DINOv2, GFLOPs=413.5, Train Params (M)=2.62025.03 | 59.57 | 80.85 | 71.16 | — | |
| STEPBackbone=CLIP, GFLOPs=307.8, Train Params (M)=2.62025.03 | 57.22 | 80.37 | 69.27 | — | |
| ST-AdaptorBackbone=CLIP, GFLOPs=911, Train Params (M)=7.12025.03 | 55.51 | 88.36 | 72.61 | — | |
| ST-AdapterPretrain=CLIP, Param (M)=7.1, Fine-tuning Protocol=PEFT2026.02 | 55.5 | 88.4 | — | 72.6 | |
| Attn ProbingBackbone=DINOv2, GFLOPs=356.3, Train Params (M)=7.32025.03 | 55.41 | 80.16 | 68.65 | — | |
| Self-Attn ProbingBackbone=CLIP, GFLOPs=308.1, Train Params (M)=2.62025.03 | 51.22 | 79.48 | 65.93 | — | |
| Attn ProbingBackbone=CLIP, GFLOPs=273.6, Train Params (M)=7.32025.03 | 49.41 | 78.69 | 64.64 | — | |
| Linear ProbingBackbone=DINOv2, GFLOPs=351.5, Train Params (M)=0.32025.03 | 40.53 | 57.79 | 49.51 | — | |
| Linear ProbingBackbone=CLIP, GFLOPs=269.6, Train Params (M)=0.32025.03 | 28.77 | 66.27 | 48.28 | — | |
| Uniformerv2Backbone=IN-21K, GFLOPs=400, Train Params (M)=1152025.03 | — | — | 76.71 | — | |
| Uniformerv2Pretrain=IN-21K, Param (M)=115, Fine-tuning Protocol=Fully Fine-tuned2026.02 | — | — | — | 76.7 | |
| VideoSwin-BPretrain=K400, Param (M)=88, Fine-tuning Protocol=Fully Fine-tuned2026.02 | — | — | — | 72.9 |