Video Object-Centric Learning on YTVIS
55ARIDSSA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DSSAencoder=frozen DINOv2 ViT-S/14, input resolution=256x256, #slot=72026.06 | 55 | 70.1 | 45.8 | 44.7 | |
| RandSF.Qtsimencoder=frozen DINOv2 ViT-S/14, input resolution=256x256, #slot=72026.06 | 46 | 60.4 | 39.4 | 38.5 | |
| RandSF.Qsscencoder=frozen DINOv2 ViT-S/14, input resolution=256x256, #slot=72026.06 | 40.1 | 58 | 37.6 | 37.2 | |
| DIASvideoencoder=frozen DINOv2 ViT-S/14, input resolution=256x256, #slot=72026.06 | 38.7 | 52.1 | 33.3 | 34.6 | |
| SlotContrastencoder=frozen DINOv2 ViT-S/14, input resolution=256x256, #slot=72026.06 | 37.2 | 49.4 | 33 | 32.8 | |
| VideoSAURencoder=frozen DINOv2 ViT-S/14, input resolution=256x256, #slot=72026.06 | 33.8 | 49.2 | 29.9 | 29.7 |