Video Instance Segmentation on YTVIS 2019 (test val)
60.4APM2F
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| M2FMask annotation=I+V, Backbone=SwinL, Supervision level=Fully-supervised2023.03 | 60.4 | 84.4 | 67 | — | — | — | — | — | |
| ViT-AdapterModel size=small, Goal PKR (%)=1002026.04 | 58.3 | — | — | — | — | 100 | 54.3 | — | |
| VPPModel size=small, Goal PKR (%)=552026.04 | 55.9 | — | — | — | — | 52.5 | 52.5 | -1.3 | |
| M2F + MaskFreeVIS*Mask annotation=I, Backbone=SwinL, Supervision level=Mask-free2023.03 | 55.3 | 82.5 | 60.8 | 50.7 | 62.2 | — | — | — | |
| VPPModel size=small, Goal PKR (%)=402026.04 | 55.3 | — | — | — | — | 39.5 | 52.2 | -2.2 | |
| M2F + MaskFreeVISMask annotation=I, Backbone=SwinL, Supervision level=Mask-free2023.03 | 54.3 | 82.6 | 61.1 | 50.2 | 61.3 | — | — | — | |
| SViTModel size=small, Goal PKR (%)=552026.04 | 52.7 | — | — | — | — | 54.9 | 49.4 | -4.7 | |
| TPSModel size=small, Goal PKR (%)=552026.04 | 51.9 | — | — | — | — | 54.4 | 48.9 | -6.8 | |
| SViTModel size=small, Goal PKR (%)=402026.04 | 50.9 | — | — | — | — | 45.9 | 47.7 | -7.5 | |
| M2F*Mask annotation=I+V, Backbone=R101, Supervision level=Fully-supervised2023.03 | 49.8 | 73.6 | 55.4 | 48 | 58 | — | — | — | |
| M2F + BoxInstBackbone=SwinL, Supervision level=Mask-free2023.03 | 49.8 | 73.2 | 55.5 | 48.2 | 58.1 | — | — | — | |
| DynViTModel size=small, Goal PKR (%)=552026.04 | 49.7 | — | — | — | — | 54.4 | 46.7 | -8.9 | |
| M2FMask annotation=I+V, Backbone=R101, Supervision level=Fully-supervised2023.03 | 49.2 | 72.8 | 54.2 | — | — | — | — | — | |
| SeqF*Mask annotation=I+V, Backbone=R101, Supervision level=Fully-supervised2023.03 | 49 | 71.1 | 55.7 | 46.8 | 56.9 | — | — | — | |
| ViT-AdapterModel size=tiny, Goal PKR (%)=1002026.04 | 49 | — | — | — | — | 100 | 45.7 | — | |
| M2F + MaskFreeVIS*Mask annotation=I, Backbone=R101, Supervision level=Mask-free2023.03 | 48.9 | 74.9 | 54.7 | 44.9 | 57 | — | — | — | |
| SeqF + MaskFreeVIS*Mask annotation=I, Backbone=R101, Supervision level=Mask-free2023.03 | 48.6 | 74 | 52.2 | 45.9 | 57.2 | — | — | — | |
| VMT*Mask annotation=I+V, Backbone=R50, Supervision level=Fully-supervised2023.03 | 47.9 | — | 52 | 45.8 | — | — | — | — | |
| VPPModel size=tiny, Goal PKR (%)=552026.04 | 47.9 | — | — | — | — | 54.5 | 44.4 | -2.4 | |
| M2F*Mask annotation=I+V, Backbone=R50, Supervision level=Fully-supervised2023.03 | 47.8 | 69.2 | 52.7 | 46.2 | 56.6 | — | — | — | |
| SeqF*Mask annotation=I+V, Backbone=R50, Supervision level=Fully-supervised2023.03 | 47.4 | 69.8 | 51.8 | 45.5 | 54.8 | — | — | — | |
| M2F + MaskFreeVISMask annotation=I, Backbone=R101, Supervision level=Mask-free, variant=improved2023.03 | 47.3 | 75.4 | 49.9 | 44.6 | 55.2 | — | — | — | |
| VPPModel size=tiny, Goal PKR (%)=402026.04 | 46.7 | — | — | — | — | 41.9 | 42.6 | -3.6 | |
| M2F + MaskFreeVIS*Mask annotation=I, Backbone=R50, Supervision level=Mask-free2023.03 | 46.6 | 72.5 | 49.7 | 44.9 | 55.7 | — | — | — | |
| M2FMask annotation=I+V, Backbone=R50, Supervision level=Fully-supervised2023.03 | 46.4 | 68 | 50 | — | — | — | — | — | |
| TPSModel size=small, Goal PKR (%)=402026.04 | 46.2 | — | — | — | — | 40.6 | 43.1 | -11.6 | |
| M2F + MaskFreeVISMask annotation=I, Backbone=R101, Supervision level=Mask-free, variant=base2023.03 | 45.8 | 70.8 | 48.6 | 45.3 | 55.2 | — | — | — | |
| M2FMask annotation=V, Backbone=R101, Supervision level=Fully-supervised2023.03 | 45.6 | 72.6 | 48.9 | 44.3 | 54.5 | — | — | — | |
| TPSModel size=tiny, Goal PKR (%)=552026.04 | 45.6 | — | — | — | — | 54.4 | 41.9 | -5.1 | |
| DynViTModel size=tiny, Goal PKR (%)=552026.04 | 44.9 | — | — | — | — | 54.4 | 41.8 | -5.1 | |
| SViTModel size=tiny, Goal PKR (%)=552026.04 | 44.9 | — | — | — | — | 55.5 | 42 | -4.4 | |
| DynViTModel size=small, Goal PKR (%)=402026.04 | 44.5 | — | — | — | — | 40.6 | 41.1 | -13.6 | |
| M2F + MaskFreeVISMask annotation=I, Backbone=R50, Supervision level=Mask-free2023.03 | 43.8 | 70.7 | 46.9 | 41.5 | 52.3 | — | — | — | |
| IFCMask annotation=I+V, Backbone=R50, Supervision level=Fully-supervised2023.03 | 42.8 | 65.8 | 46.8 | 43.8 | 51.2 | — | — | — | |
| SViTModel size=tiny, Goal PKR (%)=402026.04 | 42.8 | — | — | — | — | 42.4 | 39.8 | -7.5 | |
| M2F + MaskFreeVISBackbone=R50, Supervision level=Mask-free2023.03 | 42.5 | 66.8 | 45.7 | 41.2 | 51.2 | — | — | — | |
| M2F + BoxInstBackbone=R101, Supervision level=Mask-free2023.03 | 40.8 | 67.8 | 42.2 | 40 | 49.2 | — | — | — | |
| InsProMask annotation=I+V, Backbone=R50, Supervision level=Fully-supervised2023.03 | 40.2 | 62.9 | 43.1 | 37.6 | 44.5 | — | — | — | |
| M2F + Flow ConsistBackbone=R50, Supervision level=Mask-free2023.03 | 40.2 | 66.3 | 41.9 | 40.5 | 49.1 | — | — | — | |
| TPSModel size=tiny, Goal PKR (%)=402026.04 | 38.7 | — | — | — | — | 40.6 | 35.5 | -12.8 | |
| M2F + BoxInstBackbone=R50, Supervision level=Mask-free2023.03 | 38.6 | 64.2 | 38.5 | 38 | 46.8 | — | — | — | |
| EfficientVISMask annotation=I+V, Backbone=R50, Supervision level=Fully-supervised2023.03 | 37.9 | 59.7 | 43 | 40.3 | 46.6 | — | — | — | |
| PCANMask annotation=I+V, Backbone=R50, Supervision level=Fully-supervised2023.03 | 36.1 | 54.9 | 39.4 | 36.3 | 41.6 | — | — | — | |
| SOLO-TrackMask annotation=I, Backbone=R50, Supervision level=Prev. Weakly-supervised2023.03 | 30.6 | 50.7 | 33.5 | 31.6 | 37.1 | — | — | — | |
| DynViTModel size=tiny, Goal PKR (%)=402026.04 | 28.1 | — | — | — | — | 40.6 | 25.7 | -21.7 | |
| FlowIRNBackbone=R50, Supervision level=Prev. Weakly-supervised2023.03 | 10.5 | 27.2 | 6.2 | 12.3 | 13.6 | — | — | — |