Video Action Recognition on CharadesEgo
14Top-1 AccuracyDINOv3
Evaluation Results
| Method | Links | |
|---|---|---|
| DINOv3Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 14 | |
| DINOv3Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 13.2 | |
| OV-Encoder (Codec)Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 12.9 | |
| OV-Encoder (Frame)Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 12.6 | |
| AIMv2Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 12.4 | |
| OV-Encoder (Codec)Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 12.3 | |
| OV-Encoder (Frame)Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 12.1 | |
| AIMv2Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 12 | |
| SigLIP2Backbone=ViT-L/16, Resolution=256, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 11.9 | |
| SigLIPBackbone=ViT-L/16, Resolution=256, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 11.7 | |
| SigLIP2Backbone=ViT-L/16, Resolution=256, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 11.6 | |
| MetaCLIP2Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=16 Frames / 4096 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 11.2 | |
| MetaCLIP2Backbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 11 | |
| SigLIPBackbone=ViT-L/16, Resolution=256, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 10.9 | |
| CLIPBackbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 10.8 | |
| MetaCLIPBackbone=ViT-L/14, Resolution=224, Input Configuration (Frames/Patches)=8 Frames / 2048 Patches, Evaluation Protocol (Attentive probe with frozen backbones)=Attentive probe with frozen backbones2026.02 | 10.4 |