Video Instance Segmentation on YouTube-VIS 2021
72.3APCAVIS
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| CAVISVar.=TCO, Backbone=ViT-L2026.06 | 72.3 | 95.5 | 82.5 | 52.4 | 76.7 | — | — | — | — | — | — | 7.5 | 4.1 | |
| CAVISVar.=TO, Backbone=ViT-L2026.06 | 71.1 | 94 | 80.6 | 51.6 | 75.7 | — | — | — | — | — | — | 6.3 | 3.2 | |
| CTVISVariant=TC-Oracle2026.06 | 68.8 | 94.6 | 77 | 50.2 | 72.2 | — | — | — | — | — | — | 21.4 | 12.8 | |
| VISAGEVariant=TC-Oracle2026.06 | 66.2 | 92 | 73.6 | 50.2 | 71.9 | — | — | — | — | — | — | 16.7 | 9.8 | |
| DVIS++Var.=TCO, Backbone=R502026.06 | 65.4 | 91.4 | 71.5 | 48.6 | 69.2 | — | — | — | — | — | — | 15.6 | 9.1 | |
| CAVISVar.=Def., Backbone=ViT-L2026.06 | 64.8 | 86.5 | 72.6 | 48.4 | 69.3 | — | — | — | — | — | — | — | — | |
| DVIS++Variant=TC-Oracle2026.06 | 64.4 | 92.5 | 71 | 47.8 | 67.6 | — | — | — | — | — | — | 16 | 7.8 | |
| MinVISVariant=TC-Oracle2026.06 | 62.9 | 92.2 | 69.9 | 47.1 | 68.5 | — | — | — | — | — | — | 20 | 11.4 | |
| CAVISVariant=TC-Oracle2026.06 | 62.2 | 90 | 66.7 | 47.1 | 65.9 | — | — | — | — | — | — | 14.2 | 8.5 | |
| CTVISVariant=T-Oracle2026.06 | 61.8 | 83.7 | 71.5 | 47 | 66.9 | — | — | — | — | — | — | 14.4 | 9.7 | |
| DVISVar.=TCO, Backbone=R502026.06 | 61 | 88.1 | 67.7 | 46.3 | 65.3 | — | — | — | — | — | — | 14.8 | 8.5 | |
| GenVISVariant=TC-Oracle2026.06 | 60.9 | 85.9 | 66.4 | 47.9 | 65.6 | — | — | — | — | — | — | 14.6 | 8.7 | |
| TarVISBackbone=SwinL, Joint Training=false, Universal=true2024.02 | 60.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| GenVIS-offBackbone=SwinL2024.02 | 60.1 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DVIS-offBackbone=SwinL, Joint Training=false, Universal=false2024.02 | 60.1 | — | — | — | — | — | — | — | — | — | — | — | — | |
| ViLLa2024.07 | 59.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| GenVISVar.=TCO, Backbone=R502026.06 | 59.2 | 83.6 | 65.3 | 47.9 | 65.1 | — | — | — | — | — | — | 12.9 | 9.5 | |
| DVISVariant=TC-Oracle2026.06 | 59.1 | 85.7 | 64.9 | 45.3 | 62.5 | — | — | — | — | — | — | 14.8 | 8.3 | |
| VISAGEVariant=T-Oracle2026.06 | 58.8 | 81.6 | 65.2 | 46.5 | 67.8 | — | — | — | — | — | — | 9.2 | 6.2 | |
| Tube-LinkBackbone=Swin-large2023.03 | 58.4 | 79.4 | 64.3 | 47.5 | 63.6 | — | — | — | — | — | — | — | — | |
| Tube-LinkBackbone=Swin-large2023.03 | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tube-LinkBackbone=SwinL, Joint Training=false, Universal=false2024.02 | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniVSBackbone=SwinL, Joint Training=true, Universal=true2024.02 | 57.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DVIS++Variant=T-Oracle2026.06 | 57.9 | 82.9 | 64 | 44.8 | 63.5 | — | — | — | — | — | — | 9.5 | 4.8 | |
| VITABackbone=Swin-large, COCO video pseudo labels=true2023.03 | 57.5 | 80.6 | 61 | 47.7 | 62.6 | — | — | — | — | — | — | — | — | |
| VITABackbone=Swin-large, COCO video pseudo labels=true2023.03 | 57.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| VITA2024.07 | 57.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DVIS++Var.=TO, Backbone=R502026.06 | 57.5 | 80.2 | 63.1 | 44.9 | 64.3 | — | — | — | — | — | — | 7.7 | 5.4 | |
| CAVISVariant=T-Oracle2026.06 | 56.7 | 82.8 | 60.2 | 42.8 | 60.7 | — | — | — | — | — | — | 8.7 | 4.2 | |
| UniVSBackbone=SwinB, Joint Training=true, Universal=true2024.02 | 56.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| IDOLBackbone=Swin-large2023.03 | 56.1 | — | — | — | — | — | — | — | — | — | — | — | — | |
| IDOLBackbone=Swin-large, COCO video pseudo labels=true2023.03 | 56.1 | 80.8 | 63.5 | 45 | 60.1 | — | — | — | — | — | — | — | — | |
| IDOLBackbone=Swin-large2023.03 | 56.1 | — | — | — | — | — | — | — | — | — | — | — | — | |
| IDOL2024.07 | 56.1 | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinVISVariant=T-Oracle2026.06 | 55.4 | 78.9 | 62.7 | 43.6 | 63.7 | — | — | — | — | — | — | 12.5 | 7.9 | |
| Min-VISBackbone=Swin-large2023.03 | 55.3 | 76.6 | 62 | 45.9 | 60.8 | — | — | — | — | — | — | — | — | |
| Min-VISBackbone=Swin-large2023.03 | 55.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinVISBackbone=SwinL2024.02 | 55.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former2024.07 | 55.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former-VISBackbone=Swin-large2023.03 | 52.6 | 76.4 | 57.2 | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former-VISBackbone=Swin-large2023.03 | 52.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| SeqFormerBackbone=Swin-large2023.03 | 51.8 | 74.6 | 58.2 | 42.8 | 58.1 | — | — | — | — | — | — | — | — | |
| SeqFormerBackbone=Swin-large2023.03 | 51.8 | — | — | — | — | — | — | — | — | — | — | — | — | |
| SeqFormer2024.07 | 51.8 | — | — | — | — | — | — | — | — | — | — | — | — | |
| GenVISVariant=T-Oracle2026.06 | 51.7 | 71.7 | 56.8 | 44 | 60.4 | — | — | — | — | — | — | 5.4 | 4.8 | |
| UniVSBackbone=SwinT, Joint Training=true, Universal=true2024.02 | 51.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DVISVariant=T-Oracle2026.06 | 51.4 | 74 | 56.4 | 40.9 | 57.1 | — | — | — | — | — | — | 7.1 | 3.9 | |
| ViT-AdaBackbone=ViT-Ada-small, PKR (Patch Keep Ratio)=55%, Hardware=Nvidia RTX2080TI, Batch Size=12026.04 | 50.4 | — | — | — | — | — | — | — | 88 | 17.14 | 6.58 | — | — | |
| GenVISVar.=TO, Backbone=R502026.06 | 50.4 | 71.9 | 54.9 | 42.8 | 59.3 | — | — | — | — | — | — | 4 | 4.5 | |
| VPPBackbone=ViT-Ada-small, PKR (Patch Keep Ratio)=55%, Hardware=Nvidia RTX2080TI, Batch Size=12026.04 | 49.8 | — | — | — | — | — | — | — | 59.9 | 25.94 | 8.13 | — | — | |
| DVIS++Var.=Def., Backbone=R502026.06 | 49.8 | 72.4 | 55.4 | 39.5 | 56 | — | — | — | — | — | — | — | — | |
| DVISVar.=TO, Backbone=R502026.06 | 49.7 | 71 | 55.6 | 40.9 | 59 | — | — | — | — | — | — | 3.5 | 3.1 | |
| VISAGEVariant=Default2026.06 | 49.5 | 71.1 | 54.1 | 40.3 | 53.7 | — | — | — | — | — | — | — | — | |
| DVIS++Variant=Default2026.06 | 48.4 | 69.7 | 52.4 | 40 | 55.2 | — | — | — | — | — | — | — | — | |
| TarVISBackbone=ResNet50, Joint Training=false, Universal=true2024.02 | 48.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CAVISVariant=Default2026.06 | 48 | 70.1 | 52.9 | 38.6 | 53.2 | — | — | — | — | — | — | — | — | |
| Tube-LinkBackbone=ResNet502023.03 | 47.9 | 70 | 50.2 | 42.3 | 55.2 | — | — | — | — | — | — | — | — | |
| Tube-LinkBackbone=ResNet502023.03 | 47.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tube-LinkBackbone=ResNet50, Joint Training=false, Universal=false2024.02 | 47.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DVIS-offBackbone=ResNet50, Joint Training=false, Universal=false2024.02 | 47.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| CTVISVariant=Default2026.06 | 47.4 | 68.9 | 51.4 | 37.3 | 52.1 | — | — | — | — | — | — | — | — | |
| SViTBackbone=ViT-Ada-small, PKR (Patch Keep Ratio)=55%, Hardware=Nvidia RTX2080TI, Batch Size=12026.04 | 46.9 | — | — | — | — | — | — | — | 59.6 | 24.87 | 8.19 | — | — | |
| UniVSBackbone=ResNet50, Joint Training=true, Universal=true2024.02 | 46.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| GenVISVar.=Def., Backbone=R502026.06 | 46.4 | 65.6 | 51.6 | 38.4 | 51.3 | — | — | — | — | — | — | — | — | |
| GenVISBackbone=ResNet502023.03 | 46.3 | 67 | 50.2 | 40.6 | 53.2 | — | — | — | — | — | — | — | — | |
| GenVIS-offBackbone=R502024.02 | 46.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| GenVISVariant=Default2026.06 | 46.3 | 66.3 | 50.8 | 39.2 | 51.6 | — | — | — | — | — | — | — | — | |
| DVISVar.=Def., Backbone=R502026.06 | 46.2 | 69.3 | 49.5 | 37.8 | 53.3 | — | — | — | — | — | — | — | — | |
| VITABackbone=ResNet50, COCO video pseudo labels=true2023.03 | 45.7 | 67.4 | 49.5 | 40.9 | 53.6 | — | — | — | — | — | — | — | — | |
| VITABackbone=ResNet50, COCO video pseudo labels=true2023.03 | 45.7 | — | — | — | — | — | — | — | — | — | — | — | — | |
| MDQEBackbone=R502024.02 | 44.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DVISVariant=Default2026.06 | 44.3 | 64.7 | 48.4 | 37 | 51.5 | — | — | — | — | — | — | — | — | |
| Min-VISBackbone=ResNet502023.03 | 44.2 | 66 | 48.1 | 39.2 | 51.7 | — | — | — | — | — | — | — | — | |
| Min-VISBackbone=ResNet502023.03 | 44.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinVISBackbone=R502024.02 | 44.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| IDOLBackbone=ResNet502023.03 | 43.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| IDOLBackbone=ResNet502023.03 | 43.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| IDOLBackbone=R502024.02 | 43.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| IDOLBackbone=SwinL2024.02 | 43.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinVISVariant=Default2026.06 | 42.9 | 64.5 | 46.8 | 35.7 | 48.5 | — | — | — | — | — | — | — | — | |
| TubeFormerBackbone=ResNet50, Axial Attention=true2023.03 | 41.2 | 60.4 | 44.7 | 40.4 | 54 | — | — | — | — | — | — | — | — | |
| TubeFormerBackbone=ResNet50 + Axial2023.03 | 41.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| TubeFormerBackbone=A-R50x64, Joint Training=false, Universal=false2024.02 | 41.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former-VISBackbone=ResNet502023.03 | 40.6 | 60.9 | 41.8 | — | — | — | — | — | — | — | — | — | — | |
| Mask2Former-VISBackbone=ResNet502023.03 | 40.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| SeqformerBackbone=ResNet502023.03 | 40.5 | 62.4 | 43.7 | 36.1 | 48.1 | — | — | — | — | — | — | — | — | |
| SeqFormerBackbone=ResNet502023.03 | 40.5 | — | — | — | — | — | — | — | — | — | — | — | — | |
| VISOLOBackbone=ResNet502023.03 | 36.9 | 54.7 | 40.2 | 30.6 | 40.9 | — | — | — | — | — | — | — | — | |
| IFCBackbone=ResNet502023.03 | 36.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| IFCBackbone=ResNet502023.03 | 35.2 | 55.9 | 37.7 | 32.6 | 42.9 | — | — | — | — | — | — | — | — | |
| Cross-VISBackbone=ResNet502023.03 | 34.2 | 54.4 | 37.9 | 30.4 | 38.2 | — | — | — | — | — | — | — | — | |
| EfficientVISBackbone=ResNet-502023.03 | 34 | 57.5 | 37.3 | 33.8 | 42.5 | — | — | — | — | — | — | — | — | |
| S2DLearning=Unsupervised, Training=In-domain2025.12 | 20.1 | 42.5 | 17.6 | — | — | 5.1 | 21.7 | 41 | — | — | — | — | — | |
| S2DTraining Data=13K Real Videos, Evaluation Protocol=Zero-Shot2025.12 | 19.8 | 41.8 | — | — | — | — | — | — | — | — | — | — | — | |
| VideoCutLER*Learning=Unsupervised, Training=In-domain, Implementation=Official checkpoint2025.12 | 18 | 37 | 16.1 | — | — | 4.9 | 17 | 36.8 | — | — | — | — | — | |
| VideoCutLERTraining Data=1.3M Syn. Videos, Evaluation Protocol=Zero-Shot2025.12 | 18 | 37 | — | — | — | — | — | — | — | — | — | — | — | |
| CutLERLearning=Unsupervised, Training=In-domain2025.12 | 12 | 28.5 | 9.3 | — | — | 2.7 | 12.7 | 27.2 | — | — | — | — | — | |
| OCLRLearning=Unsupervised, Training=In-domain2025.12 | 0.9 | 4.3 | 0.1 | — | — | 0.1 | 1 | 4.9 | — | — | — | — | — | |
| MotionGroupLearning=Unsupervised, Training=In-domain2025.12 | 0.1 | 0.3 | 0 | — | — | 0 | 0.2 | 0.1 | — | — | — | — | — |