Video Instance Segmentation on YouTube-VIS 2019 (val)
69.4APCAVIS
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| CAVISBackbone=ViT-L, temporal refiner=true2024.07 | 69.4 | 90.9 | 77.2 | 58.3 | 74.7 | — | — | — | — | — | — | |
| PMTBackbone=ViT-L [14], Pre-training=DINOv3, Encoder status=frozen, GFLOPs=617, FPS=1132026.03 | 69.2 | — | 76.5 | — | 74.6 | — | — | — | — | — | — | |
| CAVISBackbone=ViT-L, temporal refiner=false2024.07 | 68.9 | 89.3 | 76.2 | 58.3 | 73.6 | — | — | — | — | — | — | |
| CAVISBackbone=ViT-L, Pre-training=DINOv2, GFLOPs=838, FPS=152026.02 | 68.9 | — | 76.2 | — | 73.6 | — | — | — | — | — | — | |
| CAVISBackbone=ViT-Adapter-L [9], Pre-training=DINOv2, Encoder status=fine-tuned, GFLOPs=838, FPS=152026.03 | 68.9 | — | 76.2 | — | 73.6 | — | — | — | — | — | — | |
| VidEoMTBackbone=ViT-L [14], Pre-training=DINOv3, Encoder status=fine-tuned, GFLOPs=566, FPS=1332026.03 | 68.9 | — | 77.4 | — | 74.8 | — | — | — | — | — | — | |
| PMTBackbone=ViT-L [14], Pre-training=DINOv2, Encoder status=frozen, GFLOPs=617, FPS=1242026.03 | 68.8 | — | 75.2 | — | 73.9 | — | — | — | — | — | — | |
| CAVISBackbone=ViT-Adapter-L [9], Pre-training=DINOv3, Encoder status=frozen, GFLOPs=838, FPS=132026.03 | 68.8 | — | 75.6 | — | 73.3 | — | — | — | — | — | — | |
| VidEoMTBackbone=ViT-L, Pre-training=DINOv2, GFLOPs=566, FPS=1602026.02 | 68.6 | — | 75.6 | — | 73.9 | — | — | — | — | — | — | |
| VidEoMTBackbone=ViT-L [14], Pre-training=DINOv2, Encoder status=fine-tuned, GFLOPs=566, FPS=1602026.03 | 68.6 | — | 75.6 | — | 73.9 | — | — | — | — | — | — | |
| CAVISBackbone=ViT-Adapter-L [9], Pre-training=DINOv2, Encoder status=frozen, GFLOPs=838, FPS=152026.03 | 68.5 | — | 75.8 | — | 73.5 | — | — | — | — | — | — | |
| DVIS++Backbone=ViT-L, temporal refiner=true2024.07 | 68.3 | 90.3 | 76.1 | 57.8 | 73.4 | — | — | — | — | — | — | |
| DVIS-DAQBackbone=ViT-L, Pre-training=DINOv2, GFLOPs=851, FPS=102026.02 | 68.3 | — | 76.1 | — | 73.5 | — | — | — | — | — | — | |
| DVIS-DAQBackbone=ViT-Adapter-L [9], Pre-training=DINOv2, Encoder status=fine-tuned, GFLOPs=851, FPS=102026.03 | 68.3 | — | 76.1 | — | 73.5 | — | — | — | — | — | — | |
| DVIS++Backbone=ViT-L, temporal refiner=false2024.07 | 67.7 | 88.8 | 75.3 | 57.9 | 73.7 | — | — | — | — | — | — | |
| DVIS++Backbone=ViT-L, Pre-training=DINOv2, GFLOPs=846, FPS=182026.02 | 67.7 | — | 75.3 | — | 73.7 | — | — | — | — | — | — | |
| DVIS++Backbone=ViT-Adapter-L [9], Pre-training=DINOv2, Encoder status=fine-tuned, GFLOPs=846, FPS=182026.03 | 67.7 | — | 75.3 | — | 73.7 | — | — | — | — | — | — | |
| GLEE-ProBackbone=EVA02-L2023.12 | 67.4 | 87.1 | 74.1 | — | — | — | — | — | — | — | — | |
| UNINEXTBackbone=ViT-H, Online=true2023.03 | 66.9 | 87.5 | 75.1 | — | — | — | — | — | — | — | — | |
| UNINEXTBackbone=ViT-H2023.12 | 66.9 | 87.5 | 75.1 | — | — | — | — | — | — | — | — | |
| CAVISBackbone=Swin-L, temporal refiner=false2024.07 | 66 | 89.5 | 73.3 | 56.8 | 71.4 | — | — | — | — | — | — | |
| NOVISBackbone=Swin-L, Training Data (Data)=CC+VIS, Temporal Configuration (T/S: clip length and stride)=4/2, Execution Mode (ON: online, OFF: offline, Near-online)=Near-online2023.08 | 65.7 | 87.8 | 72.2 | 56.3 | 70.3 | 10 | — | — | — | — | — | |
| NOVISBackbone=Swin-L2023.12 | 65.7 | 87.8 | 72.2 | — | — | — | — | — | — | — | — | |
| DVIS-DAQBackbone=Swin-L, Pre-training=IN21K, GFLOPs=415, FPS=132026.02 | 65.7 | — | 73.6 | — | 70.7 | — | — | — | — | — | — | |
| DVIS-DAQBackbone=Large2023.03 | 65.7 | — | 73.6 | — | 70.7 | — | — | — | — | — | — | |
| NOVISBackbone=Large2023.03 | 65.7 | 87.8 | 72.2 | 56.3 | 70.3 | — | — | — | — | — | — | |
| DVIS-DAQBackbone=Swin-L [26], Pre-training=IN21K, Encoder status=fine-tuned, GFLOPs=415, FPS=132026.03 | 65.7 | — | 73.6 | — | 70.7 | — | — | — | — | — | — | |
| CTVISBackbone=Swin-L, temporal refiner=false2024.07 | 65.6 | 87.7 | 72.2 | 56.5 | 70.4 | — | — | — | — | — | — | |
| MinVISBackbone=ViT-L, temporal refiner=false2024.07 | 65.6 | 85.4 | 72.7 | 57.5 | 70.6 | — | — | — | — | — | — | |
| CTVISBackbone=Swin-L, Params.=216M2023.07 | 65.6 | 87.7 | 72.2 | 56.5 | 70.4 | — | — | — | — | — | — | |
| CTVISBackbone=Swin-L2026.06 | 65.6 | 87.7 | 72.2 | 56.5 | 70.4 | — | — | — | — | — | — | |
| DVISBackbone=Swin-L, Running Mode=Offline2023.06 | 64.9 | 88 | 72.7 | 56.5 | 70.3 | — | — | — | — | — | — | |
| DVISBackbone=Swin-L2023.12 | 64.9 | 88 | 72.7 | — | — | — | — | — | — | — | — | |
| DVISBackbone=Large2023.03 | 64.9 | 88 | 72.7 | 56.5 | 70.3 | — | — | — | — | — | — | |
| SA-VISBackbone=Swin-L2026.06 | 64.6 | 88.5 | 72.1 | 56 | 70 | — | — | — | — | — | — | |
| RefineVISBackbone=Swin-L, Evaluation Protocol=offline2023.06 | 64.4 | 88.3 | 72.2 | 55.8 | 68.4 | — | — | — | — | — | — | |
| IDOLBackbone=Swin-L, temporal refiner=false2024.07 | 64.3 | 87.5 | 71 | 55.6 | 69.1 | — | — | — | — | — | — | |
| IDOLBackbone=Swin-L, Type=online, FPS=17.6, Data=YouTube-VIS, Pre-training=COCO pseudo key-reference frame pairs, Resolution=480p2022.07 | 64.3 | 87.5 | 71 | 55.6 | 69.1 | — | — | — | — | — | — | |
| IDOLBackbone=Swin-L, Inference Mode=Online2022.11 | 64.3 | 87.5 | 71 | 55.6 | 69.1 | — | — | — | — | — | — | |
| IDOLBackbone=Swin-L2023.06 | 64.3 | 87.5 | 71 | 55.6 | 69.1 | — | — | — | — | — | — | |
| RefineVISBackbone=Swin-L, Evaluation Protocol=online2023.06 | 64.3 | 87.6 | 70.9 | 55.8 | 68.2 | — | — | — | — | — | — | |
| IDOLBackbone=Swin-L, Online=true2023.03 | 64.3 | 87.5 | 71 | — | — | — | — | — | — | — | — | |
| UNINEXTBackbone=ConvNeXt-L, Online=true2023.03 | 64.3 | 87.2 | 71.7 | — | — | — | — | — | — | — | — | |
| IDOLBackbone=Swin-L, Running Mode=Online2023.06 | 64.3 | 87.5 | 71 | 55.6 | 69.1 | — | — | — | — | — | — | |
| IDOLBackbone=Swin-L, Params.=213M2023.07 | 64.3 | 87.5 | 71 | 55.5 | 69.1 | — | — | — | — | — | — | |
| IDOLBackbone=Swin-L, Training Data (Data)=CC+VIS, Temporal Configuration (T/S: clip length and stride)=Online, Execution Mode (ON: online, OFF: offline, Near-online)=Online2023.08 | 64.3 | 87.5 | 71 | 55.6 | 69.1 | 17.6 | — | — | — | — | — | |
| IDOLBackbone=Swin-L2023.12 | 64.3 | 87.5 | 71 | — | — | — | — | — | — | — | — | |
| UNINEXTBackbone=ConvNeXt-L2023.12 | 64.3 | 87.2 | 71.7 | — | — | — | — | — | — | — | — | |
| IDOLBackbone=Large2023.03 | 64.3 | 87.5 | 71 | 55.6 | 69.1 | — | — | — | — | — | — | |
| UNINEXTBackbone=Large2023.03 | 64.3 | 87.2 | 71.7 | — | — | — | — | — | — | — | — | |
| IDOLBackbone=Swin-L2026.06 | 64.3 | 87.5 | 71 | 55.5 | 69.1 | — | — | — | — | — | — | |
| TCOVISBackbone=Swin-L, temporal refiner=false2024.07 | 64.1 | 86.6 | 69.5 | 55.8 | 69 | — | — | — | — | — | — | |
| GenVISBackbone=Swin-L, temporal refiner=false2024.07 | 64 | 84.9 | 68.3 | 56.1 | 69.4 | — | — | — | — | — | — | |
| GenVISonlineBackbone=Swin-L, Inference Mode=Online2022.11 | 64 | 84.9 | 68.3 | 56.1 | 69.4 | — | — | — | — | — | — | |
| GenVISBackbone=Large2023.03 | 64 | 84.9 | 68.3 | 56.1 | 69.4 | — | — | — | — | — | — | |
| GenVISBackbone=Swin-L2026.06 | 64 | 84.9 | 68.3 | 56.1 | 69.4 | — | — | — | — | — | — | |
| SA-VIS5Backbone=Swin-L2026.06 | 64 | 87.6 | 71.6 | 55.4 | 69.4 | — | — | — | — | — | — | |
| DVISBackbone=Swin-L, temporal refiner=false2024.07 | 63.9 | 87.2 | 70.4 | 56.2 | 69 | — | — | — | — | — | — | |
| DVISBackbone=Swin-L, Running Mode=Online2023.06 | 63.9 | 87.2 | 70.4 | 56.2 | 69 | — | — | — | — | — | — | |
| DVISBackbone=Swin-L, Pre-training=IN21K, GFLOPs=411, FPS=232026.02 | 63.9 | — | 70.4 | — | 69 | — | — | — | — | — | — | |
| OmniTrackerBackbone=Large2023.03 | 63.9 | 88 | 70.1 | 55.1 | 68.5 | — | — | — | — | — | — | |
| DVISBackbone=Swin-L [26], Pre-training=IN21K, Encoder status=fine-tuned, GFLOPs=411, FPS=232026.03 | 63.9 | — | 70.4 | — | 69 | — | — | — | — | — | — | |
| GenVISsemi-onlineBackbone=Swin-L, Inference Mode=Semi-Online / Offline2022.11 | 63.8 | 85.7 | 68.5 | 56.3 | 68.4 | — | — | — | — | — | — | |
| NOVISBackbone=Swin-L, Training Data (Data)=VIS, Temporal Configuration (T/S: clip length and stride)=4/2, Execution Mode (ON: online, OFF: offline, Near-online)=Near-online2023.08 | 63.8 | 86.6 | 69.3 | 55.9 | 68.7 | 10 | — | — | — | — | — | |
| GenVISBackbone=Swin-L2023.12 | 63.8 | 85.7 | 68.5 | — | — | — | — | — | — | — | — | |
| GLEE-PlusBackbone=Swin-L2023.12 | 63.6 | 85.2 | 70.5 | — | — | — | — | — | — | — | — | |
| GLEEBackbone=Large2023.03 | 63.6 | 85.2 | 70.5 | — | — | — | — | — | — | — | — | |
| VITABackbone=Swin-L, temporal refiner=false2024.07 | 63 | 86.9 | 67.9 | 56.3 | 68.1 | — | — | — | — | — | — | |
| VITABackbone=Swin-L, Mode=Offline2022.06 | 63 | 86.9 | 67.9 | 56.3 | 68.1 | — | — | — | — | — | — | |
| VITABackbone=Swin-L, Inference Mode=Semi-Online / Offline2022.11 | 63 | 86.9 | 67.9 | 56.3 | 68.1 | — | — | — | — | — | — | |
| VITABackbone=Swin-L2023.06 | 63 | 86.9 | 67.9 | 56.3 | 68.1 | — | — | — | — | — | — | |
| VITABackbone=Swin-L, Online=false2023.03 | 63 | 86.9 | 67.9 | — | — | — | — | — | — | — | — | |
| VITABackbone=Swin-L, Running Mode=Offline2023.06 | 63 | 86.9 | 67.9 | 56.3 | 68.1 | — | — | — | — | — | — | |
| VITABackbone=Swin-L, Params.=229M2023.07 | 63 | 86.9 | 67.9 | 56.3 | 68.1 | — | — | — | — | — | — | |
| VITABackbone=Swin-L, Training Data (Data)=CC+VIS, Temporal Configuration (T/S: clip length and stride)=Offline, Execution Mode (ON: online, OFF: offline, Near-online)=Offline2023.08 | 63 | 86.9 | 67.9 | 56.3 | 68.1 | — | — | — | — | — | — | |
| VITABackbone=Swin-L2023.12 | 63 | 86.9 | 67.9 | — | — | — | — | — | — | — | — | |
| VITABackbone=Large2023.03 | 63 | 86.9 | 67.9 | 56.3 | 68.1 | — | — | — | — | — | — | |
| IDOLBackbone=Large, Pre-training configuration=reproduced2023.03 | 63 | 87 | 69.7 | 55 | 67.9 | — | — | — | — | — | — | |
| VITABackbone=Swin-L2026.06 | 63 | 86.9 | 67.9 | 56.3 | 68.1 | — | — | — | — | — | — | |
| UNINEXTBackbone=Large, Pre-training configuration=noObjPre2023.03 | 61.8 | 85.4 | 68.1 | 55 | 68.1 | — | — | — | — | — | — | |
| MinVISBackbone=Swin-L, temporal refiner=false2024.07 | 61.6 | 83.3 | 68.6 | 54.8 | 66.6 | — | — | — | — | — | — | |
| MinVISBackbone=Swin-L, Inference Mode=Online2022.11 | 61.6 | 83.3 | 68.6 | 54.8 | 66.6 | — | — | — | — | — | — | |
| MinVISBackbone=Swin-L2023.06 | 61.6 | 83.3 | 68.6 | 54.8 | 66.6 | — | — | — | — | — | — | |
| MinVISBackbone=Swin-L, Running Mode=Online2023.06 | 61.6 | 83.3 | 68.6 | 54.8 | 66.6 | — | — | — | — | — | — | |
| MinVISBackbone=Swin-L, Params.=216M2023.07 | 61.6 | 83.3 | 68.6 | 54.8 | 66.6 | — | — | — | — | — | — | |
| MinVISBackbone=Swin-L, Pre-training=IN21K, GFLOPs=401, FPS=292026.02 | 61.6 | — | 68.6 | — | 66.6 | — | — | — | — | — | — | |
| MinVISBackbone=Large2023.03 | 61.6 | 83.3 | 68.6 | 54.8 | 66.6 | — | — | — | — | — | — | |
| MinVISBackbone=Swin-L [26], Pre-training=IN21K, Encoder status=fine-tuned, GFLOPs=401, FPS=292026.03 | 61.6 | — | 68.6 | — | 66.6 | — | — | — | — | — | — | |
| MinVISBackbone=Swin-L2026.06 | 61.6 | 83.3 | 68.6 | 54.8 | 66.6 | — | — | — | — | — | — | |
| IDOLBackbone=Swin-L, Type=online, FPS=17.6, Data=YouTube-VIS2022.07 | 61.5 | 84.2 | 69.3 | 53.3 | 65.6 | — | — | — | — | — | — | |
| IDOLBackbone=Swin-L, Training Data (Data)=VIS, Temporal Configuration (T/S: clip length and stride)=Online, Execution Mode (ON: online, OFF: offline, Near-online)=Online2023.08 | 61.5 | 84.2 | 69.3 | 53.3 | 65.6 | 17.6 | — | — | — | — | — | |
| CAROQBackbone=Swin-L, temporal refiner=false2024.07 | 61.4 | 82.8 | 68.6 | 55.2 | 68.1 | — | — | — | — | — | — | |
| Mask2Formerbackbone=Swin-L, data=YouTubeVIS-2019 train set, aggregation=best of 5 runs2021.12 | 60.7 | 84.4 | 66.7 | — | — | — | — | — | — | — | — | |
| Mask2Former-VISBackbone=Swin-L, temporal refiner=false2024.07 | 60.4 | 84.4 | 67 | — | — | — | — | — | — | — | — | |
| Mask2Formerbackbone=Swin-L, data=YouTubeVIS-2019 train set, aggregation=median of 5 runs2021.12 | 60.4 | 84.4 | 67 | — | — | — | — | — | — | — | — | |
| Mask2FormerBackbone=Swin-L, Method Mode=Offline2022.07 | 60.4 | 84.4 | 67 | — | — | — | — | — | — | — | — | |
| Mask2Former-VISBackbone=Swin-L, Mode=Offline2022.06 | 60.4 | 84.4 | 67 | — | — | — | — | — | — | — | — | |
| Mask2Former-VISBackbone=Swin-L, Inference Mode=Semi-Online / Offline2022.11 | 60.4 | 84.4 | 67 | — | — | — | — | — | — | — | — | |
| Mask2Former-VISBackbone=Swin-L, Running Mode=Offline2023.06 | 60.4 | 84.4 | 67 | — | — | — | — | — | — | — | — | |
| Mask2Former-VISBackbone=Swin-L, Params.=216M2023.07 | 60.4 | 84.4 | 67 | — | — | — | — | — | — | — | — |