Action Recognition on HRI-30
89.8Overall AccuracyFrame2Freq-MS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Frame2Freq-MSPretrain=DINOv2, Param (M)=7.3, Fine-tuning Protocol=PEFT2026.02 | 89.8 | 85.6 | 98.9 | |
| Frame2Freq-STPretrain=DINOv2, Param (M)=3.5, Fine-tuning Protocol=PEFT2026.02 | 87.7 | 82.3 | 98.6 | |
| STEPBackbone=DINOv2, GFLOPs=413.1, Train Params (M)=2.62025.03 | 87.02 | 82.14 | 96.78 | |
| SlowOnlyPretrain=K400, Param (M)=32, Fine-tuning Protocol=Fully Fine-tuned2026.02 | 86.6 | — | — | |
| SlowOnlyBackbone=K400, GFLOPs=75, Train Params (M)=322025.03 | 86.55 | — | — | |
| M2-CLIPPretrain=CLIP, Param (M)=14.8, Fine-tuning Protocol=PEFT2026.02 | 85.9 | 81.8 | 95.1 | |
| M2-CLIPBackbone=CLIP, GFLOPs=935, Train Params (M)=14.82025.03 | 85.85 | 81.75 | 95.07 | |
| Frame2Freq-MSPretrain=CLIP, Param (M)=7.3, Fine-tuning Protocol=PEFT2026.02 | 85.7 | 79.1 | 98.9 | |
| ST-AdapterPretrain=DINOv2, Param (M)=7.1, Fine-tuning Protocol=PEFT2026.02 | 85.5 | 81.5 | 95.3 | |
| ST-AdaptorBackbone=DINOv2, GFLOPs=1099, Train Params (M)=7.12025.03 | 85.45 | 81.5 | 95.3 | |
| Frame2Freq-STPretrain=CLIP, Param (M)=3.5, Fine-tuning Protocol=PEFT2026.02 | 82.9 | 75.4 | 97.9 | |
| ST-AdapterPretrain=CLIP, Param (M)=7.1, Fine-tuning Protocol=PEFT2026.02 | 81.1 | 73.8 | 95.7 | |
| ST-AdaptorBackbone=CLIP, GFLOPs=911, Train Params (M)=7.12025.03 | 81.07 | 73.75 | 95.71 | |
| M2-CLIPPretrain=DINOv2, Param (M)=14.8, Fine-tuning Protocol=PEFT2026.02 | 80.5 | 78.4 | 84.6 | |
| M2-CLIPBackbone=DINOv2, GFLOPs=1128, Train Params (M)=14.82025.03 | 80.47 | 78.39 | 84.64 | |
| Self-Attn ProbingBackbone=DINOv2, GFLOPs=413.5, Train Params (M)=2.62025.03 | 76.19 | 74.28 | 80 | |
| VitaCLIPPretrain=CLIP, Param (M)=29.0, Fine-tuning Protocol=PEFT2026.02 | 71 | 60.5 | 91.8 | |
| VitaCLIPBackbone=CLIP, GFLOPs=937, Train Params (M)=28.62025.03 | 70.95 | 60.53 | 91.78 | |
| STEPBackbone=CLIP, GFLOPs=307.8, Train Params (M)=2.62025.03 | 66.66 | 56.25 | 87.5 | |
| Attn ProbingBackbone=DINOv2, GFLOPs=356.3, Train Params (M)=7.32025.03 | 62.61 | 57.5 | 72.85 | |
| VitaCLIPPretrain=DINOv2, Param (M)=29.0, Fine-tuning Protocol=PEFT2026.02 | 62 | 49.7 | 86.8 | |
| VitaCLIPBackbone=DINOv2, GFLOPs=1130, Train Params (M)=28.62025.03 | 56.31 | 57.87 | 53.21 | |
| Self-Attn ProbingBackbone=CLIP, GFLOPs=308.1, Train Params (M)=2.62025.03 | 56.19 | 45.35 | 77.85 | |
| Attn ProbingBackbone=CLIP, GFLOPs=273.6, Train Params (M)=7.32025.03 | 42.5 | 30.71 | 66.07 | |
| Linear ProbingBackbone=DINOv2, GFLOPs=351.5, Train Params (M)=0.32025.03 | 33.33 | 23.75 | 52.5 | |
| Linear ProbingBackbone=CLIP, GFLOPs=269.6, Train Params (M)=0.32025.03 | 24.76 | 19.46 | 35.35 |