Referring Video Object Segmentation on Ref-YouTube-VOS
72.5J&FRCoT-Seg
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| RCoT-SegMLLM=Qwen2.5-VL-3B2026.05 | 72.5 | 70.5 | 74.6 | — | — | — | |
| VRS-HQ-13BMLLM=Chat-UniVi-13B2026.05 | 71 | 69 | 73.1 | — | — | — | |
| GeoLaVTotal Params=202M2026.06 | 70.5 | 69.1 | 71.8 | — | — | — | |
| VRS-HQLVLM=Chat-UniVi-7B2026.05 | 70.4 | 68.3 | 72.5 | — | — | — | |
| ReferDINOTotal Params=230M2026.06 | 69.3 | 67 | 71.5 | — | — | — | |
| SAMWISEVisual Encoder=Hiera-B, Text Encoder=RoBERTa, Total Params=202 M2024.11 | 69.2 | 67.8 | 70.6 | — | — | — | |
| SAMWISETotal Params=202M2026.06 | 69.2 | 67.8 | 70.6 | — | — | — | |
| HyperSeg-3BBackbone=Swin-B2024.11 | 68.5 | — | — | — | — | — | |
| SteerSegLVLM=Qwen2VL-7B2026.05 | 67.9 | 65.9 | 70 | — | — | — | |
| S-HTRBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true2024.03 | 67.5 | 65.6 | 69.4 | 65 | 56.2 | 12.8 | |
| ViLLa2024.07 | 67.5 | 64.6 | 70.4 | — | — | — | |
| MUTRVisual Encoder=V-Swin-B, Text Encoder=RoBERTa, Total Params=250 M2024.11 | 67.5 | 65.4 | 69.6 | — | — | — | |
| MUTRTotal Params=250M2026.06 | 67.5 | 65.4 | 69.6 | — | — | — | |
| GLUS-7BMLLM=LLaVA-7B2026.05 | 67.3 | 65.5 | 69 | — | — | — | |
| GLUSLVLM=LLaVA-7B2026.05 | 67.3 | 65.5 | 69 | — | — | — | |
| GLUSATotal Params=7B2026.06 | 67.3 | 65.5 | 69 | — | — | — | |
| SAMWISEVisual Encoder=Hiera-B, Text Encoder=CLIP-B, Total Params=150 M2024.11 | 67.2 | 65.2 | 69.3 | — | — | — | |
| SteerSegLVLM=Qwen2.5VL-7B2026.05 | 67.2 | 65.3 | 69.1 | — | — | — | |
| SAMWISETotal Params=150M2026.06 | 67.2 | 65.2 | 69.3 | — | — | — | |
| HTRBackbone=Swin-L, Pre-training (RefCOCO/g/+)=true2024.03 | 67.1 | 65.3 | 68.9 | 64 | 54.4 | 11.6 | |
| DsHmp2024.07 | 67.1 | 65 | 69.1 | — | — | — | |
| DsHmpVisual Encoder=V-Swin B, Text Encoder=RoBERTa, Total Params=339 M2024.11 | 67.1 | 65 | 69.1 | — | — | — | |
| DsHmpTotal Params=339M2026.06 | 67.1 | 65 | 69.1 | — | — | — | |
| HTRBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true2024.03 | 66.7 | 64.9 | 68.6 | 64.8 | 56.7 | 12.2 | |
| GLUSSTotal Params=7B2026.06 | 66.6 | 65 | 68.3 | — | — | — | |
| UNINEXTBackbone=ConvNeXt-L2024.11 | 66.2 | — | — | — | — | — | |
| SOCBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true, Number of queries=20, Number of epochs=302024.03 | 66 | 64.1 | 67.9 | 58.6 | 49.5 | 11.9 | |
| SOCVisual Encoder=V-Swin-B, Text Encoder=RoBERTa, Total Params=220 M2024.11 | 66 | 64.1 | 67.9 | — | — | — | |
| SOCTotal Params=220M2026.06 | 66 | 64.1 | 67.9 | — | — | — | |
| LAVTTotal Params=239M2026.06 | 65.8 | 63.6 | 67.9 | — | — | — | |
| SgMgBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true2024.03 | 65.7 | 63.9 | 67.4 | 55.7 | 48.4 | 11.4 | |
| VATEX2024.04 | 65.4 | 63.3 | 67.5 | — | — | — | |
| EPCFormerVisual Backbone=ViT-H, Text Backbone=BERT2023.08 | 65 | 62.9 | 67.2 | — | — | — | |
| DMFormerBackbone=Swin-L, Pre-training (RefCOCO/g/+)=true2024.03 | 64.9 | 63.4 | 66.5 | — | — | — | |
| EVIS-1BReference=-, Backbone=InternVL2-1B2026.06 | 64.4 | 62.6 | 66.2 | — | — | — | |
| SSATotal Params=474M2026.06 | 64.3 | 62.2 | 66.4 | — | — | — | |
| HTRBackbone=VideoSwin-T, Pre-training (RefCOCO/g/+)=true2024.03 | 64.2 | 62.7 | 65.7 | 63.3 | 53.8 | 10.9 | |
| EVIS†Reference=-, Backbone=Swin-T2026.06 | 64.1 | 62.2 | 66 | — | — | — | |
| VLTBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true2024.03 | 63.8 | 61.9 | 65.6 | — | — | — | |
| VLT2024.04 | 63.8 | 61.9 | 65.6 | — | — | — | |
| VLTVisual Backbone=Video-Swin-B, Text Backbone=BERT2023.08 | 63.8 | 61.9 | 65.6 | — | — | — | |
| VLT+TCReference=TPAMI’23, Backbone=Video-Swin-B2026.06 | 63.8 | 61.9 | 65.6 | — | — | — | |
| VideoLISA-3.8BBackbone=ViT-H2024.11 | 63.7 | — | — | — | — | — | |
| VideoLISA-3.8BMLLM=LLaVA-Phi-3-V2026.05 | 63.7 | 61.7 | 65.7 | — | — | — | |
| VideoLISALVLM=LLaVA-Phi-3-V2026.05 | 63.7 | 61.7 | 65.7 | — | — | — | |
| LoShReference=CVPR’24, Backbone=Swin-T2026.06 | 63.7 | 62 | 65.4 | — | — | — | |
| VideoLISA-3.8BReference=NeurIPS’24, Backbone=LLaVA-Phi-3-3.8B2026.06 | 63.7 | 61.7 | 65.7 | — | — | — | |
| DsHmpReference=CVPR’24, Backbone=Swin-T/Video-Swin-T2026.06 | 63.6 | 61.8 | 65.4 | — | — | — | |
| OnlineReferBackbone=Swin-L, Pre-training (RefCOCO/g/+)=true2024.03 | 63.5 | 61.6 | 65.5 | 54 | 44.8 | 7.7 | |
| OnlineReferBackbone=Swin-L2024.11 | 63.5 | — | — | — | — | — | |
| OnlineReferVisual Encoder=Swin-L, Text Encoder=RoBERTa, Total Params=232 M2024.11 | 63.5 | 61.6 | 65.5 | — | — | — | |
| OnlineReferTotal Params=232M2026.06 | 63.5 | 61.6 | 65.5 | — | — | — | |
| HTMLBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true2024.03 | 63.4 | 61.5 | 65.2 | — | — | — | |
| HTMLVisual Backbone=Swin-L, Text Backbone=RoBERTa2023.08 | 63.4 | 61.5 | 65.3 | — | — | — | |
| HTMLVisual Backbone=Video-Swin-B, Text Backbone=RoBERTa2023.08 | 63.4 | 61.5 | 65.2 | — | — | — | |
| HTMLReference=ICCV’23, Backbone=Video-Swin-B2026.06 | 63.4 | 61.5 | 65.2 | — | — | — | |
| VISA-13BBackbone=ViT-H2024.11 | 63 | — | — | — | — | — | |
| VISA2024.07 | 63 | 61.4 | 64.7 | — | — | — | |
| VISA-13BMLLM=Chat-UniVi-13B2026.05 | 63 | 61.4 | 64.7 | — | — | — | |
| VISA-13BTotal Params=13B2026.06 | 63 | 61.4 | 64.7 | — | — | — | |
| ReferFormerBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true2024.03 | 62.9 | 61.3 | 64.6 | 54.8 | 46.3 | 8 | |
| OnlineReferBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true2024.03 | 62.9 | 61 | 64.7 | 54.4 | 43.2 | 7.1 | |
| ReferFormer2024.04 | 62.9 | 61.3 | 64.5 | — | — | — | |
| ReferFormerBackbone=Video-Swin-B2024.11 | 62.9 | — | — | — | — | — | |
| ReferFormerVisual Backbone=Video-Swin-B, Text Backbone=RoBERTa2023.08 | 62.9 | 61.3 | 64.6 | — | — | — | |
| ReferFormer2024.07 | 62.9 | 61.3 | 64.6 | — | — | — | |
| OnlineRefer2024.07 | 62.9 | 61 | 64.7 | — | — | — | |
| ReferFormerVisual Encoder=V-Swin-B, Text Encoder=RoBERTa, Total Params=237 M2024.11 | 62.9 | 61.3 | 64.6 | — | — | — | |
| ReferFormerTotal Params=237M2026.06 | 62.9 | 61.3 | 64.6 | — | — | — | |
| ReferFormerReference=CVPR’22, Backbone=Video-Swin-B2026.06 | 62.9 | 61.3 | 64.6 | — | — | — | |
| OnlineReferReference=ICCV’23, Backbone=Swin-B2026.06 | 62.9 | 61 | 64.7 | — | — | — | |
| SOCBackbone=VideoSwin-T, Pre-training (RefCOCO/g/+)=true, Number of queries=20, Number of epochs=302024.03 | 62.4 | 61.1 | 63.7 | 57.6 | 46.9 | 8 | |
| ReferFormerBackbone=Swin-L, Pre-training (RefCOCO/g/+)=true2024.03 | 62.4 | 60.8 | 64 | 53.2 | 44.7 | 7.6 | |
| ReferFormerVisual Backbone=Swin-L, Text Backbone=RoBERTa2023.08 | 62.4 | 60.8 | 64 | — | — | — | |
| SOCReference=NeurIPS’23, Backbone=Video-Swin-T2026.06 | 62.4 | 61.1 | 63.7 | — | — | — | |
| TempCDVisual Backbone=Video-Swin-T, Text Backbone=RoBERTa2023.08 | 62.3 | 60.5 | 64 | — | — | — | |
| TempCDReference=ICCV’23, Backbone=Video-Swin-T2026.06 | 62.3 | 60.5 | 64 | — | — | — | |
| SgMgVisual Backbone=Video-Swin-T, Text Backbone=RoBERTa2023.08 | 62 | 60.4 | 63.5 | — | — | — | |
| SgMgReference=ICCV’23, Backbone=Video-Swin-T2026.06 | 62 | 60.4 | 63.5 | — | — | — | |
| VideoLISA2024.07 | 61.7 | 60.2 | 63.3 | — | — | — | |
| One-Token-Seg-AllVisual Encoder=ViT-H, Text Encoder=Phi-3, Total Params=3.8 B2024.11 | 61.7 | 60.2 | 63.3 | — | — | — | |
| One-Token-Seg-AllTotal Params=3.8B2026.06 | 61.7 | 60.2 | 63.3 | — | — | — | |
| S-HTRBackbone=VideoSwin-T2024.03 | 61.5 | 60 | 63 | 62.2 | 50.5 | 8.5 | |
| VISAVisual Encoder=ViT-H, Text Encoder=Chat-UniVi, Total Params=7 B2024.11 | 61.5 | 59.8 | 63.2 | — | — | — | |
| VISA-7BMLLM=Chat-UniVi-7B2026.05 | 61.5 | 59.8 | 63.2 | — | — | — | |
| VISALVLM=Chat-UniVi-7B2026.05 | 61.5 | 59.8 | 63.2 | — | — | — | |
| VISA-7BTotal Params=7B2026.06 | 61.5 | 59.8 | 63.2 | — | — | — | |
| VISA-7BReference=ECCV’24, Backbone=Chat-UniVi-7B2026.06 | 61.5 | 59.8 | 63.2 | — | — | — | |
| R2VOSBackbone=VideoSwin-T, Pre-training (RefCOCO/g/+)=true2024.03 | 61.3 | 59.6 | 63.1 | — | — | — | |
| R2-VOSVisual Backbone=Video-Swin-T, Text Backbone=RoBERTa2023.08 | 61.3 | 59.6 | 63.1 | — | — | — | |
| R2-VOSReference=ICCV’23, Backbone=Video-Swin-T2026.06 | 61.3 | 59.6 | 63.1 | — | — | — | |
| HTMLBackbone=VideoSwin-T, Pre-training (RefCOCO/g/+)=true2024.03 | 61.2 | 59.5 | 63 | — | — | — | |
| HTMLVisual Backbone=Video-Swin-T, Text Backbone=RoBERTa2023.08 | 61.2 | 59.5 | 63 | — | — | — | |
| DecAF*LVLM=Qwen2.5VL-7B2026.05 | 59.9 | 56.2 | 63.5 | — | — | — | |
| HTRBackbone=VideoSwin-T2024.03 | 59.8 | 58.3 | 61.3 | 60.4 | 47.8 | 8.2 | |
| TCE-RVOSVisual Encoder=ResNet-50, Text Encoder=RoBERTa2024.11 | 59.6 | 58.3 | 60.8 | — | — | — | |
| TCE-RVOSTotal Params=-2026.06 | 59.6 | 58.3 | 60.8 | — | — | — | |
| Track-GPT-13BMLLM=LLaVA-13B2026.05 | 59.5 | 58.1 | 60.8 | — | — | — | |
| ReferFormerBackbone=VideoSwin-T, Pre-training (RefCOCO/g/+)=true2024.03 | 59.4 | 58 | 60.9 | 50.5 | 40.8 | 5.9 | |
| SOCBackbone=VideoSwin-T, Number of queries=20, Number of epochs=302024.03 | 59.2 | 57.8 | 60.5 | 52.9 | 42.2 | 8 |