Video Object Segmentation on Davis 2017
84Jaccard Index (J)XMem
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| XMemvenue=ECCV'22, Training Data=with video data2023.04 | 84 | 91.4 | 87.7 | |
| RDEvenue=CVPR'22, Training Data=with video data2023.04 | 82.1 | 90 | 86.1 | |
| SWEMvenue=CVPR'22, Training Data=with video data2023.04 | 81.2 | 87.4 | 84.3 | |
| STMBackbone=ViTAE-T-Stage, Params (M)=192021.06 | 79.4 | 85.5 | 82.5 | |
| STMBackbone=ResNet-50, Params (M)=392021.06 | 79.2 | 84.3 | 81.8 | |
| STMvenue=ICCV'19, Training Data=with video data2023.04 | 79.2 | 84.3 | 81.8 | |
| DINO1st-frame-GT=true, RGB=true, Flow=false2022.07 | 77.7 | 79.6 | 78.7 | |
| MAMP1st-frame-GT=true, RGB=true, Flow=false2022.07 | 76.4 | 75.2 | 75.8 | |
| AFB-URRvenue=NeurIPS'20, Training Data=with video data2023.04 | 73 | 76.1 | 74.6 | |
| CRW1st-frame-GT=true, RGB=true, Flow=false2022.07 | 72.9 | 74.1 | 73.4 | |
| SegGPTvenue=this work, Training Data=without video data2023.04 | 72.5 | 78.6 | 75.6 | |
| DINTR2024.10 | 72.5 | 78.4 | 75.4 | |
| MAST1st-frame-GT=true, RGB=true, Flow=false2022.07 | 71 | 70.8 | 70.9 | |
| Proposed2026.03 | 69.12 | 73.21 | — | |
| AGAMEvenue=CVPR'19, Training Data=with video data2023.04 | 67.2 | 72.7 | 70 | |
| UVC1st-frame-GT=true, RGB=true, Flow=false2022.07 | 66.2 | 64.7 | 65.5 | |
| Siam R-CNN2024.10 | 66.1 | 75 | 70.6 | |
| OCLR (test. adap.)1st-frame-GT=false, RGB=true, Flow=true2022.07 | 65.2 | 63.6 | 64.4 | |
| UNICORN2024.10 | 65.2 | 73.2 | 69.2 | |
| AGSSvenue=ICCV'19, Training Data=with video data2023.04 | 64.9 | 69.9 | 67.4 | |
| T-CoReBackbone=ViT-B/16, Epoch=200, Pre-trained=Kinetics-4002025.03 | 64.6 | 68.2 | 66.4 | |
| DINO v2Backbone=ViT-B/16, Epoch=200, Pre-trained=Kinetics-4002025.03 | 63.3 | 66.6 | 64.9 | |
| iBOT +OursType=Self Distillation, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 63.3 | 66.9 | 65.1 | |
| B-DINO2026.03 | 63.01 | 68.17 | — | |
| iBOTType=Self Distillation, Backbone=ViT-B/16, Pre-training Dataset=INet, Epoch=400, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 63 | 66.1 | 64.6 | |
| B-SDXL2026.03 | 62.33 | 68.24 | — | |
| DINO +OursType=Self Distillation, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 62.3 | 66 | 64.2 | |
| DINO v2 +OursType=Self Distillation, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 61.9 | 65.4 | 63.7 | |
| Standard AttentionAttention=Standard, Pre-training=iBOT, Backbone=ViT-B/162026.03 | 61.9 | 64.2 | 63.1 | |
| QUESTAttention=QUEST, Pre-training=iBOT, Backbone=ViT-B/162026.03 | 61.8 | 64.5 | 63.2 | |
| DINO v2Type=Self Distillation, Backbone=ViT-B/16, Pre-training Dataset=INet, Epoch=100, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 61.6 | 64.5 | 63.1 | |
| DINOType=Self Distillation, Backbone=ViT-B/16, Pre-training Dataset=INet, Epoch=300, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 60.9 | 65.5 | 63.2 | |
| DINO + SelfPatchBackbone=ViT-S/162022.06 | 60.7 | 64.7 | 62.7 | |
| MoCo v3 +OursType=Contrastive Learning, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 60.6 | 65.2 | 62.9 | |
| BLIP +OursType=Contrastive Learning, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 60.2 | 63.8 | 62 | |
| MoCo v3Type=Contrastive Learning, Backbone=ViT-B/16, Pre-training Dataset=INet, Epoch=300, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 60 | 65.1 | 62.6 | |
| SiamMAEType=Video Pretrained, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=400, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 59.4 | 62.4 | 60.9 | |
| DINOBackbone=ViT-S/162022.06 | 59.1 | 62.4 | 60.7 | |
| UniTrack2024.10 | 58.4 | — | — | |
| MAE +OursType=Mask Modeling, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 58 | 61.2 | 59.6 | |
| RSPBackbone=ViT-B/16, Epoch=400, Pre-trained=Kinetics-4002025.03 | 57.8 | 63.2 | 60.5 | |
| RSPType=Video Pretrained, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=400, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 57.8 | 63.2 | 60.5 | |
| B-DINOv22026.03 | 57.73 | 64.03 | — | |
| SwAVBackbone=ResNet502022.06 | 57.6 | 57.3 | 57.4 | |
| I-JEPA +OursType=Mask Modeling, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 57.4 | 59.9 | 58.7 | |
| BLIPType=Contrastive Learning, Backbone=ViT-B/16, Pre-training Dataset=LAION, Epoch=20, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 57.3 | 60.3 | 58.8 | |
| DetCoBackbone=ResNet502022.06 | 57 | 56.4 | 56.7 | |
| CLIP +OursType=Contrastive Learning, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=+5, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 57 | 59.7 | 58.3 | |
| CropMAEBackbone=ViT-B/16, Epoch=400, Pre-trained=Kinetics-4002025.03 | 56.9 | 58.7 | 57.8 | |
| CropMAEType=Video Pretrained, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=400, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 56.9 | 58.7 | 57.8 | |
| MoCo-v2Backbone=ResNet502022.06 | 56 | 55 | 55.5 | |
| MAE-STBackbone=ViT-L/16, Epoch=1600, Pre-trained=Kinetics-4002025.03 | 55.5 | 53.6 | 54.6 | |
| MAE-STType=Video Pretrained, Backbone=ViT-L/16, Pre-training Dataset=K400, Epoch=1600, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 55.5 | 53.6 | 54.6 | |
| EgoViTWT-allTraining Data=Full Walking Tours dataset2026.03 | 55 | 58.9 | 57 | |
| OCLR (flow-only)1st-frame-GT=false, RGB=false, Flow=true2022.07 | 54.5 | 55.7 | 55.1 | |
| SiamMask2024.10 | 54.3 | 58.5 | 56.4 | |
| CorrFlow1st-frame-GT=true, RGB=true, Flow=false2022.07 | 54.2 | 53.7 | 54 | |
| iBOTTraining Data=WT-Zurich (65-minute)2026.03 | 53.5 | 54.3 | 53.9 | |
| B-MAE2026.03 | 53.49 | 62.81 | — | |
| CLIPType=Contrastive Learning, Backbone=ViT-B/16, Pre-training Dataset=WIT, Epoch=32, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 53.4 | 56.4 | 54.9 | |
| I-JEPAType=Mask Modeling, Backbone=ViT-B/16, Pre-training Dataset=INet, Epoch=800, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 52.9 | 54.8 | 53.9 | |
| EgoViTZurichTraining Data=WT-Zurich (65-minute)2026.03 | 52.7 | 55.9 | 54.3 | |
| DenseCLBackbone=ResNet502022.06 | 52.6 | 48.9 | 50.7 | |
| AttMaskTraining Data=WT-Zurich (65-minute)2026.03 | 52.5 | 51.8 | 52.2 | |
| DINOTraining Data=WT-Zurich (65-minute)2026.03 | 52.5 | 55.1 | 53.8 | |
| MoBYBackbone=ViT-S/162022.06 | 52 | 57.3 | 54.7 | |
| DORATraining Data=WT-Zurich (65-minute)2026.03 | 51.9 | 55.6 | 53.8 | |
| DropMAEBackbone=ViT-B/16, Epoch=1600, Pre-trained=Kinetics-4002025.03 | 51.8 | 55 | 53.4 | |
| DropMAEType=Video Pretrained, Backbone=ViT-B/16, Pre-training Dataset=K400, Epoch=1600, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 51.8 | 55 | 53.4 | |
| SimCLRTraining Data=WT-Zurich (65-minute)2026.03 | 51.5 | 53.1 | 52.3 | |
| ReSimBackbone=ResNet502022.06 | 51.2 | 47.3 | 49.3 | |
| MoCo-v3Backbone=ViT-S/162022.06 | 51.2 | 55.9 | 53.5 | |
| MAEType=Mask Modeling, Backbone=ViT-B/16, Pre-training Dataset=INet, Epoch=800, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 51 | 53.9 | 52.4 | |
| MoCo-v3Training Data=WT-Zurich (65-minute)2026.03 | 50.9 | 54 | 52.5 | |
| Mask R-CNN (flow-only)1st-frame-GT=false, RGB=false, Flow=true2022.07 | 50.4 | 50.2 | 50.3 | |
| MAETraining Data=WT-Zurich (65-minute)2026.03 | 50.3 | 52.2 | 51.3 | |
| B-CLIP2026.03 | 45.82 | 61.23 | — | |
| Motion Grouping (sup.)1st-frame-GT=false, RGB=false, Flow=true2022.07 | 44.9 | 34.2 | 39.5 | |
| VideoMAEType=Video Pretrained, Backbone=ViT-L/16, Pre-training Dataset=K400, Epoch=1600, Evaluation Protocol=Zero-shot semi-supervised2026.03 | 43.6 | 46.5 | 45 | |
| B-ResNet2026.03 | 40.25 | 44.92 | — | |
| Motion Grouping1st-frame-GT=false, RGB=false, Flow=true2022.07 | 38.4 | 33.2 | 35.8 | |
| Paintervenue=CVPR'23, Training Data=without video data2023.04 | 28.5 | 40.8 | 34.6 | |
| DINOv3-LModel Size=Large2026.03 | — | — | 73.2 | |
| OmniStream2026.03 | — | — | 71.6 | |
| V-JEPA2-LModel Size=Large2026.03 | — | — | 44.2 |