Action Recognition on EPIC-KITCHENS 100 (val)
68.3Top-1 AccuracyV-JEPA 2-L + TrAction
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| V-JEPA 2-L + TrActionInput size=16×256²×3 = 3.1M, Fusion protocol=late fusion2026.06 | 68.3 | — | — | — | |
| V-JEPA 2-LInput size=16×256²×3 = 3.1M, Fusion protocol=base2026.06 | 67.2 | — | — | — | |
| VideoPrism-B + TrActionInput size=16×224²×3 = 2.4M, Fusion protocol=late fusion2026.06 | 64.5 | — | — | — | |
| DINOv2-B + TrActionInput size=16×224²×3 = 2.4M, Fusion protocol=late fusion2026.06 | 63.5 | — | — | — | |
| SigLIP-2-B + TrActionInput size=16×224²×3 = 2.4M, Fusion protocol=late fusion2026.06 | 63.4 | — | — | — | |
| VideoPrism-BInput size=16×224²×3 = 2.4M, Fusion protocol=base2026.06 | 62.9 | — | — | — | |
| DINOv2-B (center) + TrActionInput size=1×224²×3 = 0.2M, Fusion protocol=late fusion2026.06 | 59.5 | — | — | — | |
| DINOv2-BInput size=16×224²×3 = 2.4M, Fusion protocol=base2026.06 | 59.1 | — | — | — | |
| SigLIP-2-BInput size=16×224²×3 = 2.4M, Fusion protocol=base2026.06 | 56.6 | — | — | — | |
| TrActionInput size=32×2500×4 = 0.3M, Fusion protocol=Trajectory-only2026.06 | 54.1 | — | — | — | |
| I3D (flow-only)Input size=16×224²×2 = 1.6M2026.06 | 54 | — | — | — | |
| DINOv2-B (center)Input size=1×224²×3 = 0.2M, Fusion protocol=base2026.06 | 44.1 | — | — | — | |
| AVION2025.03 | — | 54.4 | — | — | |
| IPL2025.03 | — | 41 | — | — | |
| LaViLa2025.03 | — | 51 | — | — | |
| LLaVAction-7Bcandidate generation=w/ action label, top-K=202025.03 | — | 58.3 | — | — | |
| LLaVAction-7Bcandidate generation=w/ action narration, top-K=202025.03 | — | 63.2 | — | — | |
| LVMAE2025.03 | — | 52.1 | — | — | |
| M&M2025.03 | — | 53.6 | — | — | |
| M&M (Ensemble)Model indices for Action=0,1,2,3,5,6,7,8,9,10, Model indices for Noun and Verb=4,5,6,7,8,9,102022.06 | — | 56.9 | 69.2 | 75 | |
| MFormer-BEvaluation Protocol=full-finetuning, Pre-train data=IN21K+K400, #Frames=16 x 3 x 102022.06 | — | — | 56.5 | 66.7 | |
| Our ViT-B/16 w/ ST-AdapterEvaluation Protocol=frozen backbone, Pre-train data=CLIP, #Frames=8 x 3 x 12022.06 | — | — | 55 | 67.6 | |
| TAdaFormer-L/142025.03 | — | 51.8 | — | — | |
| TIM2025.03 | — | 56.4 | — | — | |
| ViT-B/16 w/o ST-AdapterEvaluation Protocol=full-finetuning, Pre-train data=CLIP, #Frames=8 x 3 x 12022.06 | — | — | 50.4 | 54.8 | |
| ViViT-LEvaluation Protocol=full-finetuning, Pre-train data=IN21K+K400, #Frames=16 x 3 x 102022.06 | — | — | 56.8 | 66.4 | |
| XViT(8x)Evaluation Protocol=full-finetuning, Pre-train data=IN21K+K400, #Frames=8 x 3 x 12022.06 | — | — | 53.3 | 66.7 |