Action Recognition on UCF101
99.9AccuracyFSAR-Qwen3
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FSAR-Qwen3Pre-training=Qwen3-VL-8B, Knowledge Prompt=Known, Shot=5-shot2026.03 | 99.9 | — | |
| FSAR-LLaVAPre-training=Video-LLaVA-7B, Knowledge Prompt=Known, Shot=5-shot2026.03 | 99.8 | — | |
| FSAR-Qwen2Pre-training=Qwen2-VL-7B, Knowledge Prompt=Known, Shot=5-shot2026.03 | 99.8 | — | |
| FSAR-Qwen3Pre-training=Qwen3-VL-2B, Knowledge Prompt=Known, Shot=5-shot2026.03 | 99.8 | — | |
| FSAR-Qwen3Pre-training=Qwen3-VL-8B, Knowledge Prompt=Unknown, Shot=5-shot2026.03 | 99.8 | — | |
| FSAR-LLaVAPre-training=Video-LLaVA-7B, Knowledge Prompt=Unknown, Shot=5-shot2026.03 | 99.7 | — | |
| FSAR-Qwen2Pre-training=Qwen2-VL-7B, Knowledge Prompt=Unknown, Shot=5-shot2026.03 | 99.7 | — | |
| FSAR-Qwen3Pre-training=Qwen3-VL-2B, Knowledge Prompt=Unknown, Shot=5-shot2026.03 | 99.7 | — | |
| VideoMAE V2Modality=V2023.03 | 99.6 | — | |
| Task-AdapterPre-training=CLIP-ViT-B, Shot=5-shot2026.03 | 99.4 | — | |
| FSAR-Qwen3Pre-training=Qwen3-VL-8B, Knowledge Prompt=Known, Shot=1-shot2026.03 | 99.3 | — | |
| CLIP-FSARPre-training=CLIP-ViT-B, Shot=5-shot2026.03 | 99.1 | — | |
| FSAR-Qwen3Pre-training=Qwen3-VL-2B, Knowledge Prompt=Known, Shot=1-shot2026.03 | 99.1 | — | |
| MVP-shotPre-training=CLIP-ViT-B, Shot=5-shot2026.03 | 99 | — | |
| FSAR-LLaVAPre-training=Video-LLaVA-7B, Knowledge Prompt=Known, Shot=1-shot2026.03 | 99 | — | |
| Qwen3-VLPre-training=Qwen3-VL-8B, Mode=Frozen Avg, Knowledge Prompt=Known, Shot=5-shot2026.03 | 98.9 | — | |
| Qwen3-VLPre-training=Qwen3-VL-8B, Mode=Frozen Avg, Knowledge Prompt=Unknown, Shot=5-shot2026.03 | 98.8 | — | |
| FSAR-Qwen2Pre-training=Qwen2-VL-7B, Knowledge Prompt=Known, Shot=1-shot2026.03 | 98.8 | — | |
| Qwen2-VLPre-training=Qwen2-VL-7B, Mode=Frozen Avg, Knowledge Prompt=Known, Shot=5-shot2026.03 | 98.7 | — | |
| Qwen3-VLPre-training=Qwen3-VL-2B, Mode=Frozen Avg, Knowledge Prompt=Known, Shot=5-shot2026.03 | 98.7 | — | |
| FSAR-Qwen3Pre-training=Qwen3-VL-2B, Knowledge Prompt=Unknown, Shot=1-shot2026.03 | 98.7 | — | |
| R(2+1)D BERT (64f)Uses Flow?=No, Extra Training Data=IG65M2020.08 | 98.69 | — | |
| R(2+1)D BERT (32f)Uses Flow?=No, Extra Training Data=IG65M2020.08 | 98.65 | — | |
| OmniSourceInput=RGB/Flow2023.03 | 98.6 | — | |
| CLIP-CPM2CPre-training=CLIP-ViT-B, Shot=5-shot2026.03 | 98.6 | — | |
| FSAR-Qwen2Pre-training=Qwen2-VL-7B, Knowledge Prompt=Unknown, Shot=1-shot2026.03 | 98.6 | — | |
| FSAR-Qwen3Pre-training=Qwen3-VL-8B, Knowledge Prompt=Unknown, Shot=1-shot2026.03 | 98.6 | — | |
| Qwen3-VLPre-training=Qwen3-VL-2B, Mode=Frozen Avg, Knowledge Prompt=Unknown, Shot=5-shot2026.03 | 98.5 | — | |
| Ours ViT-L (336↑)Modality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning, Backbone=ViT-L, Resolution=3362022.07 | 98.2 | — | |
| EMP-NetPre-training=CLIP-ViT-B, Shot=5-shot2026.03 | 98.2 | — | |
| Qwen2-VLPre-training=Qwen2-VL-7B, Mode=Frozen Avg, Knowledge Prompt=Unknown, Shot=5-shot2026.03 | 98.2 | — | |
| R(2+1)D (32f)Uses Flow?=No, Extra Training Data=IG65M2020.08 | 98.17 | — | |
| MARS + RGB + FlowUses Flow?=Yes, Extra Training Data=Kinetics-4002020.08 | 98.1 | — | |
| Ours ViT-LModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning, Backbone=ViT-L2022.07 | 98.1 | — | |
| Video-LLaVAPre-training=Video-LLaVA-7B, Mode=Frozen Avg, Knowledge Prompt=Known, Shot=5-shot2026.03 | 98.1 | — | |
| FSAR-LLaVAPre-training=Video-LLaVA-7B, Knowledge Prompt=Unknown, Shot=1-shot2026.03 | 98.1 | — | |
| Task-AdapterPre-training=CLIP-ViT-B, Shot=1-shot2026.03 | 98 | — | |
| Video-LLaVAPre-training=Video-LLaVA-7B, Mode=Frozen Avg, Knowledge Prompt=Unknown, Shot=5-shot2026.03 | 97.9 | — | |
| ResNeXt101 BERTUses Flow?=Yes, Extra Training Data=Kinetics-4002020.08 | 97.87 | — | |
| I3DUses Flow?=Yes, Extra Training Data=Kinetics-4002020.08 | 97.8 | — | |
| CapFSARPre-training=BLIP-ViT-B, Shot=5-shot2026.03 | 97.7 | — | |
| ResNeXt101Uses Flow?=Yes, Extra Training Data=Kinetics-4002020.08 | 97.46 | — | |
| TDNPretrain=ImageNet + Kinetics, Backbone=ResNet502020.12 | 97.4 | — | |
| TDNModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 97.4 | — | |
| R(2+1)DUses Flow?=Yes, Extra Training Data=Kinetics-4002020.08 | 97.3 | — | |
| Qwen3-VLPre-training=Qwen3-VL-8B, Mode=Frozen Avg, Knowledge Prompt=Known, Shot=1-shot2026.03 | 97.3 | — | |
| Qwen3-VLPre-training=Qwen3-VL-8B, Mode=Frozen Avg, Knowledge Prompt=Unknown, Shot=1-shot2026.03 | 97.2 | — | |
| Hidden Two-Stream NetworkBackbone=I3D2017.04 | 97.1 | — | |
| CLIP-FSARPre-training=CLIP-ViT-B, Shot=1-shot2026.03 | 97 | — | |
| FASTER32Pre-train (ImageNet)=false, Pre-train (Kinetics)=true2019.06 | 96.9 | — | |
| TEAPretrain=ImageNet + Kinetics, Backbone=ResNet502020.12 | 96.9 | — | |
| STRMPre-training=INet-RN50, Shot=5-shot2026.03 | 96.9 | — | |
| R(2+1)D-34Pre-train (ImageNet)=false, Pre-train (Kinetics)=true2019.06 | 96.8 | — | |
| S3DPre-train (ImageNet)=true, Pre-train (Kinetics)=true2019.06 | 96.8 | — | |
| R(2+1)DUses Flow?=No, Extra Training Data=Kinetics-4002020.08 | 96.8 | — | |
| R(2+1)DBackbone=Inception V1, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 96.8 | — | |
| S3D-GBackbone=Inception V1, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 96.8 | — | |
| S3DPretrain=ImageNet+Kinetics, Backbone=Inception V22020.12 | 96.8 | — | |
| R(2+1)DPretrain=Kinetics, Backbone=ResNet342020.12 | 96.8 | — | |
| R(2+1)DModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 96.8 | — | |
| S3D-GModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 96.8 | — | |
| MVP-shotPre-training=CLIP-ViT-B, Shot=1-shot2026.03 | 96.8 | — | |
| TEINetBackbone=ResNet-50, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 96.7 | — | |
| TEINetModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 96.7 | — | |
| MVFNetBackbone=ResNet-50, Pre-train=Kinetics, Modality=RGB, Frames=16, Splits=32020.12 | 96.6 | — | |
| MVFNetModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 96.6 | — | |
| GgHMPre-training=INet-RN50, Shot=5-shot2026.03 | 96.3 | — | |
| Qwen2-VLPre-training=Qwen2-VL-7B, Mode=Frozen Avg, Knowledge Prompt=Known, Shot=1-shot2026.03 | 96.3 | — | |
| STMBackbone=ResNet-50, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 96.2 | — | |
| STMPretrain=ImageNet + Kinetics, Backbone=ResNet502020.12 | 96.2 | — | |
| STMBackbone=2D R50, Pretrain=ImageNet+Kinetics2021.06 | 96.2 | — | |
| CT-NetBackbone=2D R50, Pretrain=ImageNet+Kinetics2021.06 | 96.2 | — | |
| STMModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 96.2 | — | |
| TEAMPre-training=INet-RN50, Shot=5-shot2026.03 | 96.2 | — | |
| VideoMAE V1Modality=V2023.03 | 96.1 | — | |
| TRXPre-training=INet-RN50, Shot=5-shot2026.03 | 96.1 | — | |
| TSMPretrain=Kinetics, Backbone=ResNet502020.12 | 96 | — | |
| Qwen3-VLPre-training=Qwen3-VL-2B, Mode=Frozen Avg, Knowledge Prompt=Known, Shot=1-shot2026.03 | 96 | — | |
| TSMUses Flow?=No, Extra Training Data=Kinetics-4002020.08 | 95.9 | — | |
| TSMBackbone=ResNet-50, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 95.9 | — | |
| TSMModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 95.9 | — | |
| Qwen3-VLPre-training=Qwen3-VL-2B, Mode=Frozen Avg, Knowledge Prompt=Unknown, Shot=1-shot2026.03 | 95.9 | — | |
| STCPre-train (ImageNet)=true, Pre-train (Kinetics)=false2019.06 | 95.8 | — | |
| Video-LLaVAPre-training=Video-LLaVA-7B, Mode=Frozen Avg, Knowledge Prompt=Known, Shot=1-shot2026.03 | 95.8 | — | |
| I3DPre-train (ImageNet)=true, Pre-train (Kinetics)=true2019.06 | 95.6 | — | |
| I3DBackbone=Inception V1, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 95.6 | — | |
| I3DPretrain=ImageNet+Kinetics, Backbone=Inception V22020.12 | 95.6 | — | |
| I3DInput=RGB/Flow2023.03 | 95.6 | — | |
| I3DModality=RGB, Pre-training=Kinetics, Transfer Protocol=Transfer Learning2022.07 | 95.6 | — | |
| TVNet-50 + IDTwith IDT=true2018.04 | 95.4 | — | |
| GDTModality=V+A2023.03 | 95.2 | — | |
| RSTAN + IDTUses Flow?=Yes, Extra Training Data=ImageNet2020.08 | 95.1 | — | |
| I3DBackbone=3D Inception, Pretrain=ImageNet+Kinetics2021.06 | 95.1 | — | |
| MoLo (OTAM)Pre-training=INet-RN50, Shot=5-shot2026.03 | 95.1 | — | |
| CLIP-CPM2CPre-training=CLIP-ViT-B, Shot=1-shot2026.03 | 95 | — | |
| Qwen2-VLPre-training=Qwen2-VL-7B, Mode=Frozen Avg, Knowledge Prompt=Unknown, Shot=1-shot2026.03 | 95 | — | |
| CoVIAR + optical flowOptical Flow=true2017.12 | 94.9 | — | |
| TSNUses Flow?=Yes, Extra Training Data=ImageNet2020.08 | 94.9 | — | |
| ECO EnBackbone=BNIncep+Res3D-18, Pre-train=Kinetics, Modality=RGB, Splits=32020.12 | 94.8 | — | |
| ECOBackbone=Inception+3D R18, Pretrain=ImageNet+Kinetics2021.06 | 94.8 | — |