Video Instance Segmentation on OVIS
49.9mAPDVIS-off
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DVIS-offBackbone=SwinL, Joint Training=false, Universal=false2024.02 | 49.9 | — | — | — | |
| UNINEXTBackbone=ViT-H, Joint Training=false, Universal=false2024.02 | 49 | — | — | — | |
| ViLLa2024.07 | 46.5 | — | — | — | |
| GenVIS-offBackbone=SwinL2024.02 | 45.4 | — | — | — | |
| TarVISBackbone=SwinL, Joint Training=false, Universal=true2024.02 | 43.2 | — | — | — | |
| IDOLBackbone=SwinL2024.02 | 42.6 | — | — | — | |
| IDOL2024.07 | 42.6 | — | — | — | |
| UniVSBackbone=SwinL, Joint Training=true, Universal=true2024.02 | 41.7 | — | — | — | |
| MinVISBackbone=SwinL2024.02 | 41.6 | — | — | — | |
| UNINEXTBackbone=ConvNeXtL, Joint Training=false, Universal=false2024.02 | 41.1 | — | — | — | |
| UniVSBackbone=SwinB, Joint Training=true, Universal=true2024.02 | 39 | — | — | — | |
| GenVIS-offBackbone=R502024.02 | 34.5 | — | — | — | |
| UNINEXTBackbone=ResNet50, Joint Training=false, Universal=false2024.02 | 34 | — | — | — | |
| DVIS-offBackbone=ResNet50, Joint Training=false, Universal=false2024.02 | 33.8 | — | — | — | |
| UniVSBackbone=SwinT, Joint Training=true, Universal=true2024.02 | 33 | — | — | — | |
| TarVISBackbone=ResNet50, Joint Training=false, Universal=true2024.02 | 31.1 | — | — | — | |
| UniVSBackbone=ResNet50, Joint Training=true, Universal=true2024.02 | 30.8 | — | — | — | |
| IDOLBackbone=R502024.02 | 30.2 | — | — | — | |
| Tube-LinkBackbone=ResNet50, Joint Training=false, Universal=false2024.02 | 29.5 | — | — | — | |
| MDQEBackbone=R502024.02 | 29.2 | — | — | — | |
| VITA2024.07 | 27.7 | — | — | — | |
| MinVISBackbone=R502024.02 | 25 | — | — | — | |
| Mask2Former2024.07 | 24.1 | — | — | — | |
| MOBIUSBackbone=MNv4-CM, FPS=8.72026.06 | — | 45.5 | 23.6 | 22.2 | |
| S2DTraining Data=13K Real Videos, Evaluation Protocol=Zero-Shot2025.12 | — | 5.3 | 1.7 | — | |
| SegFSSlow Model=MOBIUS, Backbone=MNv4-CM, FPS=38.22026.06 | — | 30.6 | 14.1 | 11.3 | |
| SegFSSlow Model=MOBIUS, Backbone=MNv4-CL, FPS=36.22026.06 | — | 34.1 | 17.3 | 16.2 | |
| SegFSSlow Model=TROY-VIS, Backbone=EfficientViT-L2, FPS=23.32026.06 | — | 29.9 | 14.8 | 14.4 | |
| VideoCutLERTraining Data=1.3M Syn. Videos, Evaluation Protocol=Zero-Shot2025.12 | — | 4.2 | 1.1 | — |