Referring Video Object Segmentation on Ref-DAVIS-17 v1.0 (test)
59.7J&F ScoreR2-VOS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| R2-VOSBackbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 59.7 | 57.2 | 62.4 | |
| ReferFormerBackbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 58.5 | 55.8 | 61.3 | |
| Wu et al.Backbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 57.9 | 53.9 | 62 | |
| LBDTBackbone=LBDT, P (Pre-trained on ref-coco+)=false2022.07 | 54.5 | — | — | |
| YOFOBackbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 52.2 | 47.5 | 56.8 | |
| URVOSBackbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 51.5 | 47.3 | 56 | |
| CMSA + RNNBackbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 40.2 | 36.9 | 43.5 | |
| CMSABackbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 34.7 | 32.2 | 37.2 |