Referring Video Object Segmentation on JHMDB-Sentences (test)
0.783Overall IoUVLP-RVOS (VLMo)
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| VLP-RVOS (VLMo)Visual Backbone=VLMo-L2024.05 | 0.783 | — | — | — | — | — | 0.766 | 0.471 | — | |
| VLP-RVOS (CLIP)Visual Backbone=ViT-L/142024.05 | 0.779 | — | — | — | — | — | 0.759 | 0.46 | — | |
| EVIS2026.06 | 0.755 | — | — | — | — | — | 0.742 | 0.462 | — | |
| LoSh2026.06 | 0.745 | — | — | — | — | — | 0.734 | 0.457 | — | |
| ReferDINOSupervision=Text + Mask, Backbone=Video-Swin-T2026.04 | 0.742 | — | — | — | — | — | 0.731 | — | — | |
| EPCFormerPublication=arXiv'232024.06 | 0.74 | 0.976 | 0.931 | 0.726 | 0.23 | 0 | 0.731 | — | — | |
| EPCFormerVisual Backbone=ViT-H, Text Backbone=BERT2023.08 | 0.74 | 0.976 | 0.931 | 0.726 | 0.23 | 0 | 0.731 | 0.455 | — | |
| DsHmp2026.06 | 0.739 | — | — | — | — | — | 0.73 | 0.458 | — | |
| SgMgBackbone=Video-Swin-B2023.07 | 0.737 | — | — | — | — | — | 0.725 | 0.45 | — | |
| SgMgPublication=ICCV'232024.06 | 0.737 | — | — | — | — | — | 0.725 | — | — | |
| VLP-RVOS (VLMo)Visual Backbone=VLMo-B2024.05 | 0.737 | — | — | — | — | — | 0.723 | 0.446 | — | |
| SgMgVisual Backbone=Video-Swin-B, Text Backbone=ROBERTa2023.08 | 0.737 | — | — | — | — | — | 0.725 | 0.45 | — | |
| SgMg2026.06 | 0.737 | — | — | — | — | — | 0.725 | 0.45 | — | |
| SOCPublication=NeurIPS'232024.06 | 0.736 | 0.969 | 0.914 | 0.711 | 0.213 | 0.1 | 0.723 | — | — | |
| VLP-RVOS (CLIP)Visual Backbone=ViT-B/162024.05 | 0.736 | — | — | — | — | — | 0.719 | 0.442 | — | |
| LoShSupervision=Text + Mask, Backbone=Video-Swin-T2026.04 | 0.736 | — | — | — | — | — | 0.727 | — | — | |
| SOC2026.06 | 0.736 | — | — | — | — | — | 0.723 | 0.446 | — | |
| OnlineReferPublication=ICCV'232024.06 | 0.735 | 0.961 | 0.904 | 0.71 | 0.219 | 0.2 | 0.719 | — | — | |
| OnlineReferVisual Backbone=Video-Swin-B2024.05 | 0.735 | — | — | — | — | — | 0.719 | — | — | |
| OnlineRefer2026.06 | 0.735 | — | — | — | — | — | 0.719 | — | — | |
| GroPrompt2024.06 | 0.733 | 0.968 | 0.908 | 0.71 | 0.232 | 0.3 | 0.724 | — | — | |
| LoShPublication=arXiv'232024.06 | 0.732 | 0.963 | 0.901 | 0.704 | 0.205 | 0.2 | 0.725 | — | — | |
| DsHmpSupervision=Text + Mask, Backbone=Video-Swin-T2026.04 | 0.731 | — | — | — | — | — | 0.721 | — | — | |
| ReferFormerBackbone=Video-Swin-B2023.07 | 0.73 | — | — | — | — | — | 0.718 | 0.437 | — | |
| ReferFormerPublication=CVPR'222024.06 | 0.73 | 0.962 | 0.902 | 0.702 | 0.21 | 0.3 | 0.718 | — | — | |
| ReferFormerVisual Backbone=Video-Swin-B, Text Backbone=ROBERTa2023.08 | 0.73 | 0.962 | 0.902 | 0.702 | 0.21 | 0.003 | 0.718 | 0.43 | — | |
| ReferFormer2026.06 | 0.73 | — | — | — | — | — | 0.718 | 0.437 | — | |
| SgMgBackbone=Video-Swin-T2023.07 | 0.728 | — | — | — | — | — | 0.717 | 0.444 | — | |
| ReferFormerVisual Backbone=Video-Swin-S2024.05 | 0.728 | — | — | — | — | — | 0.715 | 0.424 | — | |
| SgMgVisual Backbone=Video-Swin-T, Text Backbone=ROBERTa2023.08 | 0.728 | — | — | — | — | — | 0.717 | 0.444 | — | |
| SOCSupervision=Text + Mask, Backbone=Video-Swin-T2026.04 | 0.727 | — | — | — | — | — | 0.716 | — | — | |
| ReferFormerBackbone=Video-Swin-T2023.07 | 0.719 | — | — | — | — | — | 0.71 | 0.422 | — | |
| Grounded-SAMPublication=arXiv'232024.06 | 0.719 | 0.953 | 0.894 | 0.7 | 0.231 | 0.3 | 0.717 | — | — | |
| ReferFormerVisual Backbone=Video-Swin-T, Text Backbone=ROBERTa2023.08 | 0.719 | 0.958 | 0.893 | 0.668 | 0.189 | 0.002 | 0.71 | 0.422 | — | |
| ReferFormerSupervision=Text + Mask, Backbone=Video-Swin-T2026.04 | 0.719 | — | — | — | — | — | 0.71 | — | — | |
| LoSh-RVisual Backbone=Video-Swin-T2024.05 | 0.716 | — | — | — | — | — | 0.713 | 0.407 | — | |
| EPCFormerVisual Backbone=ResNet-50, Text Backbone=BERT2023.08 | 0.711 | 0.948 | 0.891 | 0.667 | 0.189 | 0 | 0.707 | 0.428 | — | |
| LOCATERBackbone=Video-Swin-T2022.03 | 0.708 | 0.936 | 0.859 | 0.619 | 16.8 | 0.3 | 0.696 | — | 0.394 | |
| SOCVisual Backbone=Video-Swin-T2024.05 | 0.707 | — | — | — | — | — | 0.701 | 0.397 | — | |
| TempCDPublication=ICCV'232024.06 | 0.706 | — | — | — | — | — | 0.696 | — | — | |
| TempCDVisual Backbone=ResNet-502024.05 | 0.706 | — | — | — | — | — | 0.696 | — | — | |
| MTTRw=102021.11 | 0.701 | 0.939 | 0.852 | 0.616 | 0.166 | 0.1 | 0.698 | 0.392 | — | |
| MTTRBackbone=Video-Swin-T2023.07 | 0.701 | — | — | — | — | — | 0.698 | 0.392 | — | |
| MTTRBackbone=Video-Swin-T2022.03 | 0.701 | 0.939 | 0.852 | 0.616 | 16.6 | 0.1 | 0.698 | — | 0.392 | |
| MTTRPublication=CVPR'222024.06 | 0.701 | 0.939 | 0.852 | 0.616 | 0.166 | 0.1 | 0.698 | — | — | |
| MTTRVisual Backbone=Video-Swin-T, Text Backbone=ROBERTa2023.08 | 0.701 | 0.939 | 0.852 | 0.616 | 0.166 | 0.001 | 0.698 | 0.392 | — | |
| ReferFormerBackbone=Video-Swin-T2022.03 | 0.7 | 0.933 | 0.842 | 0.614 | 16.4 | 0.3 | 0.693 | — | 0.391 | |
| OCPGSupervision=Text + Box, Backbone=Video-Swin-T2026.04 | 0.689 | — | — | — | — | — | 0.686 | — | — | |
| MTTRw=82021.11 | 0.674 | 0.91 | 0.815 | 0.57 | 0.144 | 0.1 | 0.679 | 0.366 | — | |
| MTTRSupervision=Text + Mask, Backbone=Video-Swin-T2026.04 | 0.674 | — | — | — | — | — | 0.679 | — | — | |
| LOCATERBackbone=ViT-B2022.03 | 0.673 | 0.893 | 0.772 | 0.508 | 10.6 | 0.2 | 0.663 | — | 0.363 | |
| LOCATERPublication=TPAMI'232024.06 | 0.673 | 0.893 | 0.772 | 0.508 | 0.106 | 0.2 | 0.663 | — | — | |
| ClawCraneNetBackbone=ResNet-50/1012023.07 | 0.656 | — | — | — | — | — | — | 0.644 | — | |
| Yang et al.Backbone=ResNet-1012022.03 | 0.652 | 0.819 | 0.736 | 0.542 | 16.8 | 0.4 | 0.627 | — | — | |
| BoxVOSSupervision=Text + Box, Backbone=Video-Swin-T2026.04 | 0.65 | — | — | — | — | — | 0.648 | — | — | |
| LBDTNumber of LBDT layers=12022.06 | 0.646 | 0.864 | 0.751 | 0.507 | 0.116 | 0.001 | 0.652 | — | 0.403 | |
| BoxLevelSetSupervision=Text + Box, Backbone=ViT-B2026.04 | 0.646 | — | — | — | — | — | 0.646 | — | — | |
| LBDTNumber of LBDT layers=42022.06 | 0.645 | 0.864 | 0.744 | 0.533 | 0.132 | 0 | 0.658 | — | 0.411 | |
| LBDT-4Visual Backbone=ResNet-502024.05 | 0.645 | — | — | — | — | — | 0.658 | 0.411 | — | |
| ClawCraneNetVisual Backbone=ResNet-50, Text Backbone=bi-LSTM2023.08 | 0.644 | 0.88 | 0.796 | 0.566 | 0.147 | 0.002 | 0.656 | — | — | |
| WRVOSPublication=arXiv'232024.06 | 0.632 | 0.82 | 0.673 | 0.414 | 0.089 | 0.1 | 0.627 | — | — | |
| WRVOSSupervision=Text + Box, Backbone=Video-Swin-T2026.04 | 0.632 | — | — | — | — | — | 0.627 | — | — | |
| BoxInstSupervision=Text + Box, Backbone=ViT-B2026.04 | 0.629 | — | — | — | — | — | 0.603 | — | — | |
| CMSA+CFSA2021.11 | 0.628 | 0.764 | 0.625 | 0.389 | 0.09 | 0.1 | 0.581 | — | — | |
| CMSA2022.06 | 0.628 | 0.764 | 0.625 | 0.389 | 0.09 | 0.001 | 0.581 | — | — | |
| CMSA + CFSAPublication=TPAMI'212024.06 | 0.628 | 0.764 | 0.625 | 0.389 | 0.09 | 0.1 | 0.581 | — | — | |
| CMSA + CFSAVisual Backbone=ResNet-1012023.08 | 0.628 | 0.764 | 0.625 | 0.389 | 0.09 | 0.001 | 0.581 | — | — | |
| OurVenue=Not Specified, Optical flow input=true, Trained on dataset=A2D Sentences, Fine-tuning=false2022.04 | 0.619 | 0.799 | 0.714 | 0.49 | 12.6 | 0.1 | 0.613 | — | 0.386 | |
| CMPC-VBackbone=I3D2021.11 | 0.616 | 0.813 | 0.657 | 0.371 | 0.07 | 0 | 0.617 | 0.342 | — | |
| CMPC-V2022.06 | 0.616 | 0.813 | 0.657 | 0.371 | 0.07 | 0 | 0.617 | — | 0.342 | |
| CMPC-VBackbone=I3D2023.07 | 0.616 | — | — | — | — | — | 0.617 | 0.342 | — | |
| CMPC-VVisual Backbone=I3D, Text Backbone=LSTM2023.08 | 0.616 | 0.813 | 0.657 | 0.371 | 0.07 | 0 | 0.617 | 0.342 | — | |
| WSRVOSSupervision=Text, Backbone=Video-Swin-B2026.04 | 0.601 | — | — | — | — | — | 0.592 | — | — | |
| CSTM2021.11 | 0.598 | 0.783 | 0.639 | 0.378 | 0.076 | 0 | 0.604 | 0.335 | — | |
| CSTM2022.06 | 0.598 | 0.783 | 0.639 | 0.378 | 0.076 | 0 | 0.604 | — | 0.335 | |
| Hui et al.Backbone=I3D2022.03 | 0.598 | 0.783 | 0.639 | 0.378 | 7.6 | 0 | 0.604 | — | 0.335 | |
| CSTMVisual Backbone=I3D, Text Backbone=GRU2023.08 | 0.598 | 0.783 | 0.639 | 0.378 | 0.076 | 0 | 0.604 | 0.335 | — | |
| CSTMVenue=CVPR2021, Optical flow input=false, Trained on dataset=A2D Sentences, Fine-tuning=false2022.04 | 0.598 | 0.783 | 0.639 | 0.378 | 7.6 | 0 | 0.604 | — | 0.335 | |
| WSRVOSSupervision=Text, Backbone=Video-Swin-T2026.04 | 0.587 | — | — | — | — | — | 0.581 | — | — | |
| AAMN2021.11 | 0.583 | 0.773 | 0.627 | 0.36 | 0.044 | 0 | 0.576 | 0.321 | — | |
| OCPGSupervision=Text + Point, Backbone=Video-Swin-T2026.04 | 0.583 | — | — | — | — | — | 0.579 | — | — | |
| ACGA2022.06 | 0.576 | 0.756 | 0.564 | 0.287 | 0.034 | 0 | 0.584 | — | 0.289 | |
| ACANBackbone=I3D2023.07 | 0.576 | — | — | — | — | — | 0.584 | 0.289 | — | |
| Wang et al. [3]Backbone=I3D2022.03 | 0.576 | 0.756 | 0.564 | 0.287 | 3.4 | 0 | 0.584 | — | 0.289 | |
| ACANVisual Backbone=I3D, Text Backbone=Word2Vec2023.08 | 0.576 | 0.756 | 0.564 | 0.287 | 0.034 | 0 | 0.584 | 0.289 | — | |
| ACGAVenue=ICCV2019, Optical flow input=false, Trained on dataset=A2D Sentences, Fine-tuning=false2022.04 | 0.576 | 0.756 | 0.564 | 0.287 | 3.4 | 0 | 0.584 | — | 0.289 | |
| SEVOSSupervision=Text + Point, Backbone=Video-Swin-T2026.04 | 0.575 | — | — | — | — | — | 0.567 | — | — | |
| Gavrilyuk et al.I3D backbone training configuration=training more layers of I3D backbone on A2D Sentences2022.06 | 0.555 | 0.712 | 0.518 | 0.264 | 0.03 | 0 | 0.57 | — | 0.267 | |
| Gavrilyuk et al.Backbone=I3D2022.03 | 0.555 | 0.712 | 0.518 | 0.264 | 3 | 0 | 0.57 | — | 0.267 | |
| CMDy2022.06 | 0.554 | 0.742 | 0.587 | 0.316 | 0.047 | 0 | 0.576 | — | 0.301 | |
| Wang et al. [7]Backbone=I3D2022.03 | 0.554 | 0.742 | 0.587 | 0.316 | 4.7 | 0 | 0.576 | — | 0.301 | |
| CMDYVenue=AAAI2020, Optical flow input=false, Trained on dataset=A2D Sentences, Fine-tuning=false2022.04 | 0.554 | 0.742 | 0.587 | 0.316 | 4.7 | 0 | 0.576 | — | 0.301 | |
| Hu et al.2021.11 | 0.546 | 0.633 | 0.35 | 0.085 | 0.002 | 0 | 0.528 | 0.178 | — | |
| Hu et al.Backbone=VGG-162023.07 | 0.546 | — | — | — | — | — | 0.528 | 0.178 | — | |
| Hu et al.Backbone=VGG-162022.03 | 0.546 | 0.633 | 0.35 | 0.085 | 0.2 | 0 | 0.528 | — | 0.178 | |
| Hu et al.Venue=ECCV2016, Optical flow input=false, Trained on dataset=A2D Sentences, Fine-tuning=false2022.04 | 0.546 | 0.633 | 0.35 | 0.085 | 0.2 | 0 | 0.528 | — | 0.178 | |
| PointVOSSupervision=Text + Point, Backbone=Video-Swin-T2026.04 | 0.545 | — | — | — | — | — | 0.526 | — | — | |
| Gavrilyuk et al.Input Modality=RGB2021.11 | 0.541 | 0.699 | 0.46 | 0.173 | 0.014 | 0 | 0.542 | 0.233 | — | |
| Gavrilyuk et al.2022.06 | 0.541 | 0.699 | 0.46 | 0.173 | 0.014 | 0 | 0.542 | — | 0.233 | |
| Gavrilyuk et al.Backbone=I3D2023.07 | 0.541 | — | — | — | — | — | 0.542 | 0.233 | — |