Video Part Segmentation on VIP
0.408mIoUiBOT +Ours
Evaluation Results
| Method | Links | |
|---|---|---|
| iBOT +OursType=Self Distillation, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.408 | |
| DINO v2 +OursType=Self Distillation, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.399 | |
| MoCo v3 +OursType=Contrastive Learning, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.398 | |
| DINO +OursType=Self Distillation, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.398 | |
| BLIP +OursType=Contrastive Learning, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.396 | |
| iBOTType=Self Distillation, Backbone=ViT-B/16, Pre-training Dataset=INet, Epoch=400, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.396 | |
| CLIP +OursType=Contrastive Learning, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.392 | |
| DINOType=Self Distillation, Backbone=ViT-B/16, Pre-training Dataset=INet, Epoch=300, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.391 | |
| T-CoReBackbone=ViT-B/16, Epoch=200, Pre-trained=Kinetics-4002025.03 | 0.389 | |
| MoCo v3Type=Contrastive Learning, Backbone=ViT-B/16, Pre-training Dataset=INet, Epoch=300, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.388 | |
| DINO v2Type=Self Distillation, Backbone=ViT-B/16, Pre-training Dataset=INet, Epoch=100, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.384 | |
| DINO v2Backbone=ViT-B/16, Epoch=200, Pre-trained=Kinetics-4002025.03 | 0.382 | |
| CLIPType=Contrastive Learning, Backbone=ViT-B/16, Pre-training Dataset=WIT, Epoch=32, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.381 | |
| BLIPType=Contrastive Learning, Backbone=ViT-B/16, Pre-training Dataset=LAION, Epoch=20, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.376 | |
| SiamMAEType=Video Pretrained, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=400, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.361 | |
| I-JEPA +OursType=Mask Modeling, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.353 | |
| RSPBackbone=ViT-B/16, Epoch=400, Pre-trained=Kinetics-4002025.03 | 0.34 | |
| ToBoPre-trained=Kinetics-400, Epochs=4002025.07 | 0.34 | |
| RSPType=Video Pretrained, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=400, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.34 | |
| RSPPre-trained=Kinetics-400, Epochs=4002025.07 | 0.338 | |
| MAE +OursType=Mask Modeling, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.338 | |
| CropMAEPre-trained=Kinetics-400, Epochs=4002025.07 | 0.337 | |
| DINOPre-trained=Kinetics-400, Epochs=4002025.07 | 0.334 | |
| DinoType=Non-contrastive, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 0.334 | |
| SiamMAEPre-trained=Kinetics-400, Epochs=4002025.07 | 0.333 | |
| SiamMAEType=Autoencoder, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 0.333 | |
| MAE-STBackbone=ViT-L/16, Epoch=1600, Pre-trained=Kinetics-4002025.03 | 0.332 | |
| MAE-STType=Video Pretrained, Backbone=ViT-L/16, Pre-training Dataset=K400, Epoch=1600, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.332 | |
| PhiNet v2Backbone=ViT-S/16, Pre-training=Kinetics-400, Pre-training Epochs=4002025.05 | 0.331 | |
| PhiNet v2Type=Non-contrastive, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 0.331 | |
| CropMAEBackbone=ViT-B/16, Epoch=400, Pre-trained=Kinetics-4002025.03 | 0.33 | |
| CropMAEType=Video Pretrained, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=400, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.33 | |
| CropMAEBackbone=ViT-S/16, Pre-training=Kinetics-400, Pre-training Epochs=4002025.05 | 0.33 | |
| CropMAEType=Autoencoder, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 0.33 | |
| MAEPre-trained=Kinetics-400, Epochs=4002025.07 | 0.325 | |
| MAEType=Autoencoder, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 0.325 | |
| MoCo v3Pre-trained=Kinetics-400, Epochs=4002025.07 | 0.324 | |
| RSPBackbone=ViT-S/16, Pre-training=Kinetics-400, Pre-training Epochs=4002025.05 | 0.324 | |
| RSPType=Autoencoder, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 0.324 | |
| MoCo v3Type=Contrastive, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 0.324 | |
| SimCLRPre-trained=Kinetics-400, Epochs=4002025.07 | 0.319 | |
| SimCLRType=Contrastive, Architecture=ViT-S/16, Pre-training dataset=Kinetics-400, Pre-training epochs=4002025.05 | 0.319 | |
| I-JEPAType=Mask Modeling, Backbone=ViT-B/16, Pre-training Dataset=INet, Epoch=800, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.315 | |
| DropMAEBackbone=ViT-B/16, Epoch=1600, Pre-trained=Kinetics-4002025.03 | 0.311 | |
| DropMAEType=Video Pretrained, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=1600, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.311 | |
| JEPA-like methodBackbone=ViT-S/16, Pre-training=Kinetics-400, Pre-training Epochs=4002025.05 | 0.301 | |
| MAEType=Mask Modeling, Backbone=ViT-B/16, Pre-training Dataset=INet, Epoch=800, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.293 | |
| VideoMAEType=Video Pretrained, Backbone=ViT-L/16, Pre-training Dataset=K400, Epoch=1600, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 0.256 |