Video Instance Segmentation on YouTube-VIS 2022 (val)
52.4APDVIS
Evaluation Results
| Method | Links | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DVISbackbone=Swin-L, inference_paradigm=offline, reproduced=true2023.11 | 52.4 | — | — | — | — | 59.9 | 82.7 | 68.3 | 47.8 | 65.2 | 44.9 | 66.3 | 48.9 | 37.1 | 53.2 | — | |
| VITAbackbone=Swin-L, inference_paradigm=offline, reproduced=true2023.11 | 49.3 | — | — | — | — | 57.6 | 80.4 | 62.5 | 47.7 | 62.3 | 41 | 62.1 | 43.9 | 39.4 | 43.5 | — | |
| DVISbackbone=Swin-L, inference_paradigm=online/near-online, reproduced=true2023.11 | 48.9 | — | — | — | — | 58.8 | 80.6 | 65.9 | 47.5 | 63.9 | 39 | 56 | 43 | 33 | 43.5 | — | |
| Axial-VS w/ Tube-Linkbackbone=Swin-L, inference_paradigm=offline, runs=averaged over 32023.11 | 48.8 | — | — | — | — | 58.7 | 81 | 64.2 | 46.6 | 63.5 | 38.9 | 64.4 | 39.3 | 32 | 42.3 | — | |
| Axial-VS w/ Tube-Linkbackbone=Swin-L, inference_paradigm=online/near-online, runs=averaged over 32023.11 | 47.3 | — | — | — | — | 58.7 | 81.1 | 64.9 | 46.9 | 62.7 | 35.9 | 62 | 37 | 34.2 | 39.7 | — | |
| Tube-Linkbackbone=Swin-L, inference_paradigm=online/near-online, reproduced=true2023.11 | 46 | — | — | — | — | 57.8 | 78.7 | 63.4 | 47 | 62.7 | 34.2 | 53.2 | 37.9 | 31.5 | 38.9 | — | |
| SA-VISBackbone=Swin-L2026.06 | 45.1 | 71.3 | 46 | 40.8 | 50.2 | — | — | — | — | — | — | — | — | — | — | — | |
| SA-VIS5Backbone=Swin-L2026.06 | 44.6 | 70.5 | 45.4 | 40.3 | 49.6 | — | — | — | — | — | — | — | — | — | — | — | |
| GenVISBackbone=Swin-L2026.06 | 44.3 | 69.9 | 44.9 | 39.9 | 48.4 | — | — | — | — | — | — | — | — | — | — | — | |
| MinVISbackbone=Swin-L, inference_paradigm=online/near-online, reproduced=true2023.11 | 43.5 | — | — | — | — | 55 | 77.8 | 60.6 | 45.3 | 60.3 | 31.9 | 51.4 | 33 | 28.2 | 35.3 | — | |
| Axial-VS w/ Tube-Linkbackbone=ResNet50, inference_paradigm=online/near-online, runs=averaged over 32023.11 | 41.6 | — | — | — | — | 46.8 | 68.1 | 50.5 | 41.5 | 56.2 | 36.5 | 61.1 | 41.7 | 32.3 | 42.3 | — | |
| DVISbackbone=ResNet50, inference_paradigm=offline, reproduced=true2023.11 | 41.6 | — | — | — | — | 47.2 | 70.8 | 51 | 40 | 54.9 | 35.9 | 58.4 | 39.9 | 32.2 | 41.9 | — | |
| Axial-VS w/ Tube-Linkbackbone=ResNet50, inference_paradigm=offline, runs=averaged over 32023.11 | 41.3 | — | — | — | — | 45.6 | 68 | 51.1 | 40.2 | 54.7 | 37 | 63.4 | 36.7 | 29 | 40.2 | — | |
| VITABackbone=Swin-L2026.06 | 41.1 | 63 | 44 | 39.3 | 44.3 | — | — | — | — | — | — | — | — | — | — | — | |
| GRAtt-VISInference Mode=Online, Backbone=ResNet-502023.05 | 40.8 | 60.1 | 45.9 | 35.7 | 46.9 | — | — | — | — | — | — | — | — | — | — | — | |
| GRAtt-VISBackbone=ResNet502026.06 | 40.8 | 60.1 | 45.9 | 35.7 | 46.9 | — | — | — | — | — | — | — | — | — | — | — | |
| Tube-Linkbackbone=ResNet50, inference_paradigm=online/near-online, reproduced=true2023.11 | 39.5 | — | — | — | — | 47.9 | 70.4 | 50.5 | 42.6 | 55.9 | 31.1 | 56.1 | 31.2 | 29.1 | 36.3 | — | |
| VITAbackbone=ResNet50, inference_paradigm=offline, reproduced=true2023.11 | 38.8 | — | — | — | — | 45.7 | 66.6 | 50.1 | 41 | 53.1 | 31.9 | 53.8 | 37 | 31.1 | 37.3 | — | |
| CAVIS2024.07 | 38.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DVISbackbone=ResNet50, inference_paradigm=online/near-online, reproduced=true2023.11 | 38.6 | — | — | — | — | 46 | 68.1 | 50.4 | 39.7 | 53.5 | 31.2 | 50.4 | 36.8 | 30.2 | 35.7 | — | |
| SA-VISBackbone=ResNet502026.06 | 38.6 | 64.3 | 42.7 | 33.3 | 44.5 | — | — | — | — | — | — | — | — | — | — | — | |
| SA-VIS5Backbone=ResNet502026.06 | 38.3 | 63.7 | 42.4 | 32.8 | 43.9 | — | — | — | — | — | — | — | — | — | — | — | |
| GenVISnear-onlinebackbone=ResNet50, inference_paradigm=online/near-online, reproduced=true2023.11 | 38.1 | — | — | — | — | 45.9 | 66.3 | 50.2 | 40.8 | 53.7 | 30.3 | 50.9 | 32.7 | 25.5 | 36.2 | — | |
| GenVIS2024.07 | 37.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GenVISInference Mode=Online, Backbone=ResNet-502023.05 | 37.5 | 61.6 | 41.5 | 32.6 | 42.2 | — | — | — | — | — | — | — | — | — | — | — | |
| GenVISBackbone=ResNet502026.06 | 37.5 | 61.6 | 41.5 | 32.6 | 42.2 | — | — | — | — | — | — | — | — | — | — | — | |
| DVIS++2024.07 | 37.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinVISInference Mode=Online, Backbone=ResNet-502023.05 | 33.1 | 54.8 | 33.7 | 29.5 | 36.6 | — | — | — | — | — | — | — | — | — | — | — | |
| MinVISBackbone=Swin-L2026.06 | 33.1 | 54.8 | 33.7 | 29.5 | 36.6 | — | — | — | — | — | — | — | — | — | — | — | |
| MinVISbackbone=ResNet50, inference_paradigm=online/near-online, reproduced=true2023.11 | 32.8 | — | — | — | — | 43.9 | 66.9 | 47.5 | 38.8 | 51.9 | 21.6 | 42.9 | 18.1 | 18.8 | 25.6 | — | |
| VITA2024.07 | 32.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VITAInference Mode=Offline, Backbone=ResNet-502023.05 | 32.6 | 53.9 | 39.3 | 30.3 | 42.6 | — | — | — | — | — | — | — | — | — | — | — | |
| VITABackbone=ResNet502026.06 | 32.6 | 53.9 | 39.3 | 30.3 | 42.6 | — | — | — | — | — | — | — | — | — | — | — | |
| InstanceFormerInference Mode=Online, Backbone=ResNet-502023.05 | 32 | 55 | 34.5 | 29.5 | 38.3 | — | — | — | — | — | — | — | — | — | — | — | |
| DVIS2024.07 | 31.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinVIS2024.07 | 23.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MinVISBackbone=ResNet502026.06 | 23.2 | 47.9 | 19.3 | 20.2 | 28 | — | — | — | — | — | — | — | — | — | — | — | |
| Axial-VSbackbone=ResNet50, inference protocol=online/near-online2023.11 | — | — | — | — | — | — | — | — | — | — | 36.5 | — | — | — | — | — | |
| Axial-VSbackbone=ResNet50, inference protocol=offline2023.11 | — | — | — | — | — | — | — | — | — | — | 37 | — | — | — | — | — | |
| CAVISBackbone=ViT-L, Pre-training=DINOv2, GFLOPs=815, FPS=15, Input resolution=default2026.02 | — | — | — | — | — | — | — | — | — | — | 39.5 | — | 40.5 | — | 44.9 | — | |
| DVISbackbone=ResNet50, inference protocol=online/near-online2023.11 | — | — | — | — | — | — | — | — | — | — | 31.2 | — | — | — | — | — | |
| DVISbackbone=ResNet50, inference protocol=offline2023.11 | — | — | — | — | — | — | — | — | — | — | 35.9 | — | — | — | — | — | |
| DVISBackbone=R502024.03 | — | — | — | — | — | 37 | — | — | — | — | 31.6 | — | — | — | — | 36.3 | |
| DVISBackbone=Swin-L2024.03 | — | — | — | — | — | 42.6 | — | — | — | — | 39.9 | — | — | — | — | 44.9 | |
| DVISBackbone=Swin-L, Pre-training=IN21K, GFLOPs=401, FPS=23, Input resolution=default2026.02 | — | — | — | — | — | — | — | — | — | — | 39.9 | — | 42.6 | — | 44.9 | — | |
| DVIS-DAQBackbone=R502024.03 | — | — | — | — | — | 35.5 | — | — | — | — | 34.6 | — | — | — | — | 41.1 | |
| DVIS-DAQBackbone=VIT-L2024.03 | — | — | — | — | — | 43 | — | — | — | — | 42 | — | — | — | — | 48.4 | |
| DVIS-DAQBackbone=ViT-L, Pre-training=DINOv2, GFLOPs=826, FPS=10, Input resolution=default2026.02 | — | — | — | — | — | — | — | — | — | — | 42 | — | 43 | — | 48.4 | — | |
| DVIS++Backbone=R502024.03 | — | — | — | — | — | 40.7 | — | — | — | — | 37.2 | — | — | — | — | 44.6 | |
| DVIS++Backbone=VIT-L2024.03 | — | — | — | — | — | 39.4 | — | — | — | — | 37.5 | — | — | — | — | 43.5 | |
| DVIS++Backbone=ViT-L, Pre-training=DINOv2, GFLOPs=820, FPS=18, Input resolution=default2026.02 | — | — | — | — | — | — | — | — | — | — | 37.5 | — | 39.4 | — | 43.5 | — | |
| MinVISBackbone=R502024.03 | — | — | — | — | — | 19.3 | — | — | — | — | 23.3 | — | — | — | — | 28 | |
| MinVISBackbone=Swin-L2024.03 | — | — | — | — | — | 33.7 | — | — | — | — | 33.1 | — | — | — | — | 36.6 | |
| MinVISBackbone=Swin-L, Pre-training=IN21K, GFLOPs=224, FPS=31, Input resolution=default2026.02 | — | — | — | — | — | — | — | — | — | — | 33.1 | — | 33.7 | — | 36.6 | — | |
| VidEoMTBackbone=ViT-L, Pre-training=DINOv2, GFLOPs=557, FPS=161, Input resolution=default2026.02 | — | — | — | — | — | — | — | — | — | — | 42.6 | — | 46.1 | — | 48.1 | — | |
| VITAbackbone=ResNet50, inference protocol=offline2023.11 | — | — | — | — | — | — | — | — | — | — | 31.9 | — | — | — | — | — |