Video Instance Parsing on VIP (val)
39.7mIoUT-CoRe
Evaluation Results
| Method | Links | |
|---|---|---|
| T-CoReType=Masked Modeling, Space Type=Latent Space, Backbone=ViT-S/16 (22M), Epoch=100, Pre-training Dataset=ImageNet-1k2025.03 | 39.7 | |
| SupervisedType=Supervised, Backbone=ResNet50 (26M), Epoch=100, Pre-training Dataset=ImageNet-1k2025.03 | 39.5 | |
| iBOTType=Masked Modeling, Space Type=Latent Space, Backbone=ViT-S/16 (22M), Epoch=800, Pre-training Dataset=ImageNet-1k2025.03 | 38.4 | |
| T-CoReType=Masked Modeling, Space Type=Latent Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 37.8 | |
| iBOTType=Masked Modeling, Space Type=Latent Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 37.4 | |
| DINO v2Type=Masked Modeling, Space Type=Latent Space, Backbone=ViT-S/16 (22M), Epoch=100, Pre-training Dataset=ImageNet-1k2025.03 | 37.3 | |
| DINO v2Type=Masked Modeling, Space Type=Latent Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 37 | |
| DINOType=Contrastive Learning, Backbone=ViT-S/16 (22M), Epoch=800, Pre-training Dataset=ImageNet-1k2025.03 | 36.2 | |
| RSPType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 33.8 | |
| CropMAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 33.7 | |
| DINOType=Contrastive Learning, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 33.4 | |
| CropMAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=ImageNet-1k2025.03 | 33.3 | |
| SiamMAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 33.2 | |
| MAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 32.5 | |
| MoCo v3Type=Contrastive Learning, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 32.4 | |
| SimCLRType=Contrastive Learning, Backbone=ViT-S/16 (22M), Epoch=400, Pre-training Dataset=Kinetics-4002025.03 | 31.9 | |
| RC-MAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=1600, Pre-training Dataset=ImageNet-1k2025.03 | 29.7 | |
| MAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-B/16 (87M), Epoch=1600, Pre-training Dataset=ImageNet-1k2025.03 | 28.1 | |
| CrOCType=Contrastive Learning, Backbone=ViT-S/16 (22M), Epoch=300, Pre-training Dataset=ImageNet-1k2025.03 | 26.1 | |
| VideoMAEType=Masked Modeling, Space Type=Pixel Space, Backbone=ViT-S/16 (22M), Epoch=1600, Pre-training Dataset=Kinetics-4002025.03 | 22.3 |