Referring Video Object Segmentation on Ref-YouTube-VOS 2019 (val)
67.5J&F ScoreReferDINO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ReferDINOSupervision=Text + Mask, Backbone=Video-Swin-T2026.04 | 67.5 | 65.5 | 69.6 | |
| SOCBackbone=Video-Swin-B, Training Setting=Joint Train2023.05 | 67.3 | 65.3 | 69.3 | |
| LoSh-SBackbone=Video-Swin-B, Number of input frames (w)=52023.06 | 67.2 | 65.4 | 69 | |
| SOCBackbone=Video-Swin-B, Training Setting=With Image Pretrain2023.05 | 66 | 64.1 | 67.9 | |
| SgMgBackbone=Video-Swin-B, Number of input frames (w)=52023.06 | 65.7 | 63.9 | 67.4 | |
| SOCBackbone=Video-Swin-T, Training Setting=Joint Train2023.05 | 65 | 63.3 | 66.7 | |
| ReferFormerBackbone=Video-Swin-B, Training Setting=Joint Train2023.05 | 64.9 | 62.8 | 67 | |
| VLTBackbone=Video-Swin-B, Training Setting=With Image Pretrain2023.05 | 63.8 | 61.9 | 65.6 | |
| LoSh-SBackbone=Video-Swin-T, Number of input frames (w)=52023.06 | 63.7 | 62 | 65.4 | |
| LoShSupervision=Text + Mask, Backbone=Video-Swin-T2026.04 | 63.7 | 62 | 65.4 | |
| DsHmpSupervision=Text + Mask, Backbone=Video-Swin-T2026.04 | 63.6 | 61.8 | 65.4 | |
| ReferFormerBackbone=Video-Swin-B, Training Setting=With Image Pretrain2023.05 | 62.9 | 61.3 | 64.6 | |
| ReferFormerBackbone=Video-Swin-B2023.06 | 62.9 | 61.3 | 64.6 | |
| ReferFormerBackbone=Video-Swin-T, Training Setting=Joint Train2023.05 | 62.6 | 59.9 | 63.3 | |
| SOCBackbone=Video-Swin-T, Training Setting=With Image Pretrain2023.05 | 62.4 | 61.1 | 63.7 | |
| SOCSupervision=Text + Mask, Backbone=Video-Swin-T2026.04 | 62.4 | 61.1 | 63.7 | |
| SgMgBackbone=Video-Swin-T, Number of input frames (w)=52023.06 | 62 | 60.4 | 63.5 | |
| ReferFormerBackbone=Video-Swin-T, Training Setting=With Image Pretrain2023.05 | 59.4 | 58 | 60.9 | |
| ReferFormerSupervision=Text + Mask, Backbone=Video-Swin-T2026.04 | 59.4 | 58 | 60.9 | |
| SOCBackbone=Video-Swin-T, Training Setting=Train from scratch2023.05 | 59.2 | 57.8 | 60.5 | |
| ReferFormerBackbone=Video-Swin-T, Training Setting=Train from scratch2023.05 | 56 | 54.8 | 57.3 | |
| MTTRBackbone=Video-Swin-T, Training Setting=Train from scratch2023.05 | 55.3 | 54 | 56.6 | |
| MTTRSupervision=Text + Mask, Backbone=Video-Swin-T2026.04 | 55.3 | 54 | 56.6 | |
| OCPGSupervision=Text + Box, Backbone=Video-Swin-T2026.04 | 52.8 | 50.4 | 55.1 | |
| WRVOSSupervision=Text + Box, Backbone=Video-Swin-T2026.04 | 50.2 | 48.9 | 51.4 | |
| MLRLBackbone=ResNet-502023.06 | 49.7 | 48.4 | 51 | |
| LBDT-4Backbone=ResNet-50, Training Setting=Train from scratch2023.05 | 49.4 | 48.2 | 50.6 | |
| BoxVOSSupervision=Text + Box, Backbone=Video-Swin-T2026.04 | 48.9 | 46.1 | 51.7 | |
| YOFOBackbone=ResNet-502023.06 | 48.6 | 47.5 | 49.7 | |
| BoxLevelSetSupervision=Text + Box, Backbone=ViT-B2026.04 | 48 | 45.4 | 50.7 | |
| CMPC-VBackbone=I3D2023.06 | 47.5 | 45.6 | 49.3 | |
| URVOSBackbone=ResNet-50, Training Setting=Train from scratch2023.05 | 47.2 | 45.3 | 49.2 | |
| BoxInstSupervision=Text + Box, Backbone=ViT-B2026.04 | 46.6 | 43.8 | 49.4 | |
| WSRVOSSupervision=Text, Backbone=Video-Swin-B2026.04 | 39.6 | 37.2 | 42 | |
| OCPGSupervision=Text + Point, Backbone=Video-Swin-T2026.04 | 36.9 | 33 | 40.8 | |
| WSRVOSSupervision=Text, Backbone=Video-Swin-T2026.04 | 36.5 | 33.5 | 39.4 | |
| SEVOSSupervision=Text + Point, Backbone=Video-Swin-T2026.04 | 33 | 29.6 | 36.5 | |
| DViN*Supervision=Text, Backbone=Video-Swin-T2026.04 | 29.4 | 26.1 | 32.7 | |
| PointVOSSupervision=Text + Point, Backbone=Video-Swin-T2026.04 | 29.1 | 25.1 | 32.5 | |
| PPT*Supervision=Text + Point, Backbone=Video-Swin-T2026.04 | 20.8 | 19.4 | 21.2 | |
| PCNet*Supervision=Text, Backbone=Video-Swin-T2026.04 | 19.7 | 17.9 | 21.6 | |
| TRIS*Supervision=Text, Backbone=Video-Swin-T2026.04 | 18.5 | 16.8 | 20.1 |