Video Instance Segmentation on YouTube-VIS 2019 (test)
61.6APMinVIS
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| MinVISBackbone=Swin-L, Training=Full2022.08 | 61.6 | 83.3 | 68.6 | 54.8 | 66.6 | |
| MinVISBackbone=Swin-L, Training=10%2022.08 | 61 | 83 | 67.7 | 54.6 | 66.1 | |
| Mask2Former-VISBackbone=Swin-L, Training=Full2022.08 | 60.4 | 84.4 | 67 | — | — | |
| SeqFormerBackbone=Swin-L, Training=Full+C80k2022.08 | 59.3 | 82.1 | 66.4 | 51.7 | 64.4 | |
| MinVISBackbone=Swin-L, Training=5%2022.08 | 59.3 | 81.4 | 65.8 | 53.8 | 64.1 | |
| MinVISBackbone=Swin-L, Training=1%2022.08 | 59 | 81.6 | 64.7 | 54 | 64 | |
| TeViTBackbone=Swin-L, Training=Full2022.08 | 56.8 | 80.6 | 63.1 | 52 | 63.3 | |
| SeqFormerBackbone=R50, Training=Full+C80k2022.08 | 47.4 | 69.8 | 51.8 | 45.5 | 54.8 | |
| MinVISBackbone=R50, Training=Full2022.08 | 47.4 | 69 | 52.1 | 45.7 | 55.7 | |
| TeViTBackbone=MsgShifT, Training=Full2022.08 | 46.6 | 71.3 | 51.6 | 44.9 | 54.3 | |
| Mask2Former-VISBackbone=R50, Training=Full2022.08 | 46.4 | 68 | 50 | — | — | |
| SeqFormerBackbone=R50, Training=Full2022.08 | 45.1 | 66.9 | 50.5 | 45.6 | 54.6 | |
| TeViTBackbone=R50, Training=Full2022.08 | 42.1 | 67.8 | 44.8 | 41.3 | 49.4 |