Video Instance Segmentation on YouTube-VIS 2021 (val)
65.3APCAVIS
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| CAVISBackbone=ViT-L, temporal refiner=true2024.07 | 65.3 | 87.3 | 73.2 | 49.7 | 70.3 | |
| CAVISBackbone=ViT-L, temporal refiner=false2024.07 | 64.6 | 85.6 | 72.5 | 49.5 | 69.3 | |
| CAVISBackbone=ViT-L, Pre-training=DINOv2, GFLOPs=824, FPS=152026.02 | 64.6 | — | 72.5 | — | 69.3 | |
| CAVISBackbone=ViT-Adapter-L [9], Pre-training=DINOv2, Encoder status=fine-tuned, GFLOPs=824, FPS=152026.03 | 64.6 | — | 72.5 | — | 69.3 | |
| CAVISBackbone=ViT-Adapter-L [9], Pre-training=DINOv2, Encoder status=frozen, GFLOPs=824, FPS=152026.03 | 64.3 | — | 72 | — | 68.9 | |
| PMTBackbone=ViT-L [14], Pre-training=DINOv3, Encoder status=frozen, GFLOPs=616, FPS=1132026.03 | 64.3 | — | 71.2 | — | 69 | |
| DVIS++Backbone=ViT-L, temporal refiner=true2024.07 | 63.9 | 86.7 | 71.5 | 48.8 | 69.5 | |
| CAVISBackbone=ViT-Adapter-L [9], Pre-training=DINOv3, Encoder status=frozen, GFLOPs=824, FPS=132026.03 | 63.9 | — | 71.6 | — | 68.2 | |
| PMTBackbone=ViT-L [14], Pre-training=DINOv2, Encoder status=frozen, GFLOPs=616, FPS=1242026.03 | 63.8 | — | 69.4 | — | 68.1 | |
| VidEoMTBackbone=ViT-L [14], Pre-training=DINOv3, Encoder status=fine-tuned, GFLOPs=560, FPS=1332026.03 | 63.2 | — | 71.6 | — | 69.1 | |
| VidEoMTBackbone=ViT-L, Pre-training=DINOv2, GFLOPs=560, FPS=1602026.02 | 63.1 | — | 69.3 | — | 68.1 | |
| VidEoMTBackbone=ViT-L [14], Pre-training=DINOv2, Encoder status=fine-tuned, GFLOPs=560, FPS=1602026.03 | 63.1 | — | 69.3 | — | 68.1 | |
| DVIS-DAQBackbone=ViT-L, Pre-training=DINOv2, GFLOPs=836, FPS=102026.02 | 62.4 | — | 70.8 | — | 68 | |
| DVIS-DAQBackbone=ViT-Adapter-L [9], Pre-training=DINOv2, Encoder status=fine-tuned, GFLOPs=836, FPS=102026.03 | 62.4 | — | 70.8 | — | 68 | |
| DVIS++Backbone=ViT-L, temporal refiner=false2024.07 | 62.3 | 82.7 | 70.2 | 49.5 | 68 | |
| DVIS++Backbone=ViT-L, Pre-training=DINOv2, GFLOPs=830, FPS=172026.02 | 62.3 | — | 70.2 | — | 68 | |
| DVIS++Backbone=ViT-Adapter-L [9], Pre-training=DINOv2, Encoder status=fine-tuned, GFLOPs=830, FPS=172026.03 | 62.3 | — | 70.2 | — | 68 | |
| RefineVISBackbone=Swin-L, Evaluation Protocol=online2023.06 | 61.4 | 84.1 | 68.5 | 48.3 | 65.2 | |
| TCOVISBackbone=Swin-L, temporal refiner=false2024.07 | 61.3 | 82.9 | 68 | 48.6 | 65.1 | |
| CTVISBackbone=Swin-L, temporal refiner=false2024.07 | 61.2 | 84 | 68.8 | 48 | 65.8 | |
| RefineVISBackbone=Swin-L, Evaluation Protocol=offline2023.06 | 61.2 | 83.7 | 69.2 | 47.9 | 64.8 | |
| CTVISBackbone=Swin-L, Params.=216M2023.07 | 61.2 | 84 | 68.8 | 48 | 65.8 | |
| CTVISBackbone=Swin-L2026.06 | 61.2 | 84 | 68.8 | 48 | 65.8 | |
| CAVISBackbone=Swin-L, temporal refiner=false2024.07 | 61.1 | 84.1 | 69.2 | 48.2 | 66.3 | |
| DVIS-DAQBackbone=Swin-L, Pre-training=IN21K, GFLOPs=410, FPS=112026.02 | 61.1 | — | 68.2 | — | 66.6 | |
| DVIS-DAQBackbone=Swin-L [26], Pre-training=IN21K, Encoder status=fine-tuned, GFLOPs=410, FPS=112026.03 | 61.1 | — | 68.2 | — | 66.6 | |
| SA-VISBackbone=Swin-L2026.06 | 60.6 | 83.7 | 68.5 | 47.8 | 65.1 | |
| TarViSBackbone=Swin-L, Shared Model=true2023.01 | 60.2 | 81.4 | 67.6 | 47.6 | 64.8 | |
| TarVISbackbone=Swin-L, inference_mode=online/near-online2023.11 | 60.2 | 81.4 | 67.6 | 47.6 | 64.8 | |
| GenVISsemi-onlineBackbone=Swin-L, Inference Mode=Semi-Online / Offline2022.11 | 60.1 | 80.9 | 66.5 | 49.1 | 64.7 | |
| DVISBackbone=Swin-L, Running Mode=Offline2023.06 | 60.1 | 83 | 68.4 | 47.7 | 65.7 | |
| GenVISnear-onlinebackbone=Swin-L, inference_mode=online/near-online2023.11 | 60.1 | 80.9 | 66.5 | 49.1 | 64.7 | |
| DVISbackbone=Swin-L, inference_mode=offline2023.11 | 60.1 | 83 | 68.4 | 47.7 | 65.7 | |
| SA-VIS5Backbone=Swin-L2026.06 | 60.1 | 82.9 | 68.1 | 47.2 | 64.5 | |
| NOVISBackbone=Swin-L, Training Data (Data)=VIS, Temporal Configuration (T/S: clip length and stride)=4/2, Execution Mode (ON: online, OFF: offline, Near-online)=Near-online2023.08 | 59.8 | 82 | 66.5 | 47.9 | 64.4 | |
| GenVISBackbone=Swin-L, temporal refiner=false2024.07 | 59.6 | 80.9 | 65.8 | 48.7 | 65 | |
| GenVISonlineBackbone=Swin-L, Inference Mode=Online2022.11 | 59.6 | 80.9 | 65.8 | 48.7 | 65 | |
| GenVISonlinebackbone=Swin-L, inference_mode=online/near-online2023.11 | 59.6 | 80.9 | 65.8 | 48.7 | 65 | |
| GenVISBackbone=Swin-L2026.06 | 59.6 | 80.9 | 65.8 | 48.7 | 65 | |
| MinVISBackbone=ViT-L, temporal refiner=false2024.07 | 59.2 | 79.9 | 66.7 | 47.8 | 64.1 | |
| Axial-VS w/ Tube-Linkbackbone=Swin-L, inference_mode=offline2023.11 | 59.1 | 81.9 | 64.9 | 46.9 | 63.8 | |
| Axial-VS w/ Tube-Linkbackbone=Swin-L, inference_mode=online/near-online2023.11 | 58.8 | 81.3 | 65 | 46.7 | 62.7 | |
| DVISBackbone=Swin-L, temporal refiner=false2024.07 | 58.7 | 80.4 | 66.6 | 47.5 | 64.6 | |
| DVISBackbone=Swin-L, Running Mode=Online2023.06 | 58.7 | 80.4 | 66.6 | 47.5 | 64.6 | |
| DVISbackbone=Swin-L, inference_mode=online/near-online2023.11 | 58.7 | 80.4 | 66.6 | 47.5 | 64.6 | |
| DVISBackbone=Swin-L, Pre-training=IN21K, GFLOPs=405, FPS=242026.02 | 58.7 | — | 66.6 | — | 64.6 | |
| DVISBackbone=Swin-L [26], Pre-training=IN21K, Encoder status=fine-tuned, GFLOPs=405, FPS=242026.03 | 58.7 | — | 66.6 | — | 64.6 | |
| Tube-Linkbackbone=Swin-L, inference_mode=online/near-online2023.11 | 58.4 | 79.4 | 64.3 | 47.5 | 63.6 | |
| VITABackbone=Swin-L, temporal refiner=false2024.07 | 57.5 | 80.6 | 61 | 47.7 | 62.6 | |
| tuantng2021.06 | 57.5 | 80.6 | 67.1 | 44.1 | 60.9 | |
| VITABackbone=Swin-L2022.06 | 57.5 | 80.6 | 61 | 47.7 | 62.6 | |
| VITABackbone=Swin-L, Inference Mode=Semi-Online / Offline2022.11 | 57.5 | 80.6 | 61 | 47.7 | 62.6 | |
| VITABackbone=Swin-L, Shared Model=false2023.01 | 57.5 | 80.6 | 61 | 47.7 | 62.6 | |
| VITABackbone=Swin-L2023.06 | 57.5 | 80.6 | 61 | 47.7 | 62.6 | |
| VITASupervision=Pixel, Backbone=Swin Large2023.03 | 57.5 | 80.6 | 61 | 47.7 | 62.6 | |
| VITABackbone=Swin-L, Running Mode=Offline2023.06 | 57.5 | 80.6 | 61 | 47.7 | 62.6 | |
| VITABackbone=Swin-L, Params.=229M2023.07 | 57.5 | 80.6 | 61 | 47.7 | 62.6 | |
| VITAbackbone=Swin-L, inference_mode=offline2023.11 | 57.5 | 80.6 | 61 | 47.7 | 62.6 | |
| VITABackbone=Swin-L2026.06 | 57.5 | 80.6 | 61 | 47.7 | 62.6 | |
| Mask2Former-VISBackbone=Swin-L, Running Mode=Offline2023.06 | 57.2 | 76.4 | 57.2 | — | — | |
| MDQESupervision=Pixel, Backbone=Swin Large2023.03 | 56.2 | 80 | 61.1 | 44.9 | 59.1 | |
| IDOLBackbone=Swin-L, temporal refiner=false2024.07 | 56.1 | 80.8 | 63.5 | 45 | 60.1 | |
| IDOLBackbone=Swin-L, Type=online2022.07 | 56.1 | 80.8 | 63.5 | 45 | 60.1 | |
| IDOLBackbone=Swin-L, Inference Mode=Online2022.11 | 56.1 | 80.8 | 63.5 | 45 | 60.1 | |
| IDOLBackbone=Swin-L, Shared Model=false2023.01 | 56.1 | 80.8 | 63.5 | 45 | 60.1 | |
| IDOLBackbone=Swin-L2023.06 | 56.1 | 80.8 | 63.5 | 45 | 60.1 | |
| IDOLSupervision=Pixel, Backbone=Swin Large2023.03 | 56.1 | 80.8 | 63.5 | 45 | 60.1 | |
| IDOLBackbone=Swin-L, Running Mode=Online2023.06 | 56.1 | 80.8 | 63.5 | 45 | 60.1 | |
| IDOLBackbone=Swin-L, Params.=213M2023.07 | 56.1 | 80.8 | 63.5 | 45 | 60.1 | |
| IDOLBackbone=Swin-L, Training Data (Data)=VIS, Temporal Configuration (T/S: clip length and stride)=Online, Execution Mode (ON: online, OFF: offline, Near-online)=Online2023.08 | 56.1 | 80.8 | 63.5 | 45 | 60.1 | |
| IDOLbackbone=Swin-L, inference_mode=online/near-online2023.11 | 56.1 | 80.8 | 63.5 | 45 | 60.1 | |
| IDOLBackbone=Swin-L2026.06 | 56.1 | 80.8 | 63.5 | 45 | 60.1 | |
| MinVISBackbone=Swin-L, temporal refiner=false2024.07 | 55.3 | 76.6 | 62 | 45.9 | 60.8 | |
| MinVISBackbone=Swin-L, Training=Full2022.08 | 55.3 | 76.6 | 62 | 45.9 | 60.8 | |
| MinVISBackbone=Swin-L, Inference Mode=Online2022.11 | 55.3 | 76.6 | 62 | 45.9 | 60.8 | |
| MinVISBackbone=Swin-L2023.06 | 55.3 | 76.6 | 62 | 45.9 | 60.8 | |
| MinVISSupervision=Pixel, Backbone=Swin Large2023.03 | 55.3 | 76.6 | 62 | 45.9 | 60.8 | |
| MinVISBackbone=Swin-L, Running Mode=Online2023.06 | 55.3 | 76.6 | 62 | 45.9 | 60.8 | |
| MinVISBackbone=Swin-L, Params.=216M2023.07 | 55.3 | 76.6 | 62 | 45.9 | 60.8 | |
| MinVISbackbone=Swin-L, inference_mode=online/near-online2023.11 | 55.3 | 76.6 | 62 | 45.9 | 60.8 | |
| MinVISBackbone=Swin-L, Pre-training=IN21K, GFLOPs=255, FPS=302026.02 | 55.3 | — | 62 | — | 60.8 | |
| MinVISBackbone=Swin-L [26], Pre-training=IN21K, Encoder status=fine-tuned, GFLOPs=255, FPS=302026.03 | 55.3 | — | 62 | — | 60.8 | |
| MinVISBackbone=Swin-L2026.06 | 55.3 | 76.6 | 62 | 45.9 | 60.8 | |
| MinVISBackbone=Swin-L, Training=10%2022.08 | 54.9 | 76.3 | 61.9 | 45.3 | 60.1 | |
| CAROQBackbone=Swin-L, temporal refiner=false2024.07 | 54.5 | 75.4 | 60.5 | 45.5 | 61.4 | |
| DeVISBackbone=SwinL, Method Mode=Near-online, T=6, S=42022.07 | 54.4 | 77.7 | 59.8 | 43.8 | 57.8 | |
| DeVISBackbone=Swin-L, Training Data (Data)=VIS, Temporal Configuration (T/S: clip length and stride)=6/4, Execution Mode (ON: online, OFF: offline, Near-online)=Near-online2023.08 | 54.4 | 77.7 | 59.8 | 43.8 | 57.8 | |
| eastonssy2021.06 | 54.3 | 79.2 | 61.1 | 43.9 | 58.8 | |
| MinVISBackbone=Swin-L, Training=5%2022.08 | 54.3 | 76.3 | 60.1 | 45.4 | 59.5 | |
| BoxVISSupervision=Box, Backbone=Swin Large, Tracker=clip-level tracker from MDQE [23]2023.03 | 53.9 | 76.4 | 59.6 | 44.8 | 61 | |
| Mask2Formerbackbone=Swin-L, data=V, resolution=shorter side to 360 pixels, statistic=best of 5 runs2021.12 | 53 | 75.9 | 58.4 | — | — | |
| MinVISBackbone=Swin-L, Training=1%2022.08 | 52.9 | 74.9 | 58.9 | 44.7 | 58.3 | |
| BoxVISSupervision=Box, Backbone=Swin Large2023.03 | 52.8 | 75.4 | 58.3 | 44.4 | 58.1 | |
| Mask2Former-VISBackbone=Swin-L, temporal refiner=false2024.07 | 52.6 | 76.4 | 57.2 | — | — | |
| Mask2Formerbackbone=Swin-L, data=V, resolution=shorter side to 360 pixels, statistic=median of 5 runs2021.12 | 52.6 | 76.4 | 57.2 | — | — | |
| Mask2Former-VISBackbone=Swin-L, Training=Full2022.08 | 52.6 | 76.4 | 57.2 | — | — | |
| Mask2FormerBackbone=Swin-L, Method Mode=Offline2022.07 | 52.6 | — | 57.2 | — | — | |
| Mask2Former-VISBackbone=Swin-L2022.06 | 52.6 | 76.4 | 57.2 | — | — | |
| Mask2Former-VISBackbone=Swin-L, Inference Mode=Semi-Online / Offline2022.11 | 52.6 | 76.4 | 57.2 | — | — | |
| M2F-VISSupervision=Pixel, Backbone=Swin Large2023.03 | 52.6 | 76.4 | 57.2 | — | — |