Action Recognition on FogAct 1.0 (test)
88.7Top-1 AccuracyOurs ViT-B/16
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Ours ViT-B/16Venue=2025, Input=8×224^2, Pre-training=WIT-400M, Views=1×1, GFLOPs=143, Param=146.92026.05 | 88.7 | 99.4 | |
| PTTD + OSTVenue=ECCV’24, Input=8×224^2, Pre-training=FogAct, Views=1×1, Param=152.22026.05 | 85.4 | 98.8 | |
| PTTD + OSTVenue=ECCV’24, Input=8×224^2, Pre-training=DIV&Flickr, Views=1×1, Param=152.22026.05 | 85.2 | 98.2 | |
| LDR + OSTVenue=CVPR’24, Input=8×224^2, Pre-training=All-weather, Views=1×1, GFLOPs=776, Param=163.62026.05 | 83.3 | 98.6 | |
| OST ViT-B/16Venue=CVPR’24, Input=8×224^2, Pre-training=WIT-400M, Views=1×1, GFLOPs=141, Param=149.62026.05 | 83.2 | 98.9 | |
| AIM ViT-B/16Venue=ICLR’23, Input=8×224^2, Pre-training=WIT-400M, Views=1×1, GFLOPs=202, Param=96.42026.05 | 80.3 | 98 | |
| ViFi-CLIP ViT-B/16Venue=CVPR’23, Input=8×224^2, Pre-training=WIT-400M, Views=1×1, GFLOPs=141, Param=124.72026.05 | 78.4 | 97.7 | |
| ActionCLIP ViT-B/16Venue=TNNLS’23, Input=8×224^2, Pre-training=WIT-400M, Views=1×1, GFLOPs=141, Param=141.72026.05 | 75 | 95.7 | |
| SFAR ViT-B/16Venue=NeurIPS’25, Input=8×224^2, Pre-training=WIT-400M, Views=1×1, GFLOPs=90.2, Param=126.12026.05 | 73.6 | 95.4 | |
| ATM ViT-B/16Venue=ICCV’23, Input=8×224^2, Pre-training=WIT-400M, Views=1×1, GFLOPs=95, Param=87.82026.05 | 73.2 | 94.5 | |
| TC-CLIP ViT-B/16Venue=ECCV’24, Input=8×224^2, Pre-training=WIT-400M, Views=1×1, Param=127.52026.05 | 71.5 | 95 | |
| X-CLIP ViT-B/16Venue=ECCV’22, Input=8×224^2, Pre-training=Kinetics-400, Views=1×1, GFLOPs=145, Param=131.52026.05 | 67.4 | 92.8 | |
| UCL + OSTVenue=TIP’24, Input=8×224^2, Pre-training=Unsupervised, Views=1×1, Param=169.12026.05 | 58 | 86.9 | |
| M2-CLIP ViT-B/16Venue=AAAI’24, Input=8×224^2, Pre-training=WIT-400M, Views=1×1, GFLOPs=214, Param=1652026.05 | 56.5 | 88.8 | |
| DINO-v2Venue=arXiv’23, Input=8×224^2, Pre-training=LVD-142M, Views=1×1, Param=86.62026.05 | 45.4 | 74.2 | |
| LLaMa-VIDVenue=ECCV’24, Input=8×224^2, Pre-training=LLaVA1.5-VI, Param=70002026.05 | 26.2 | — | |
| Vita-CLIP ViT-B/16Venue=CVPR’23, Input=8×224^2, Pre-training=WIT-400M, Views=1×1, GFLOPs=97, Param=161.82026.05 | 18.8 | 43.8 | |
| BIKE ViT-B/16Venue=CVPR’23, Input=8×224^2, Pre-training=WIT-400M, Views=1×1, Param=124.12026.05 | 13.4 | 19.5 | |
| VideoMAE ViT-B/16Venue=NeurIPS’22, Input=8×224^2, Pre-training=Kinetics-400, Views=1×1, GFLOPs=90, Param=872026.05 | 11.1 | 31.1 |