Referring Video Object Segmentation on Ref-DAVIS 17
74.3J&F ScoreViLLa
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ViLLa2024.07 | 74.3 | 70.6 | 78 | |
| UNINEXTBackbone=ViT-H2023.03 | 72.5 | 68.2 | 76.8 | |
| GeoLaVTotal Params=202M2026.06 | 72.5 | 69.9 | 75.2 | |
| MPG-SAM 22025.01 | 72.4 | 68.8 | 76 | |
| HyperSeg-3BBackbone=Swin-B2024.11 | 71.2 | — | — | |
| SAMWISEVisual Encoder=Hiera-B, Text Encoder=RoBERTa, Total Params=202 M2024.11 | 70.6 | 67.4 | 74.5 | |
| SAMWISETotal Params=202M2026.06 | 70.6 | 67.4 | 73.5 | |
| VISAReference=ECCV'242025.01 | 70.4 | 67 | 73.8 | |
| VISABackbone=Chat-UniVi-13B2024.07 | 70.4 | 67 | 73.8 | |
| VISA-13BBackbone=ViT-H2024.11 | 70.4 | — | — | |
| VISA2024.07 | 70.4 | 67 | 73.8 | |
| VD-ITReference=ECCV'242025.01 | 69.4 | 66.2 | 72.6 | |
| VISABackbone=Chat-UniVi-7B2024.07 | 69.4 | 66.3 | 72.5 | |
| VISAVisual Encoder=ViT-H, Text Encoder=Chat-UniVi, Total Params=7 B2024.11 | 69.4 | 66.3 | 72.5 | |
| VISA-7BTotal Params=7B2026.06 | 69.4 | 66.3 | 72.5 | |
| VISA-7BReference=ECCV’24, Backbone=Chat-UniVi-7B2026.06 | 69.4 | 66.3 | 72.5 | |
| ReferDINOBackbone=Swin-B2025.01 | 68.9 | 65.1 | 72.9 | |
| ReferDINOTotal Params=230M2026.06 | 68.9 | 65.1 | 72.9 | |
| VideoLISA-3.8BConfiguration=Post-optimization, Year=20242024.09 | 68.8 | 64.9 | 72.7 | |
| VideoLISA-3.8BBackbone=ViT-H2024.11 | 68.8 | — | — | |
| VideoLISA-3.8BReference=NeurIPS’24, Backbone=LLaVA-Phi-3-3.8B2026.06 | 68.8 | 64.9 | 72.7 | |
| EVIS-1BReference=-, Backbone=InternVL2-1B2026.06 | 68.8 | 65.8 | 71.8 | |
| SAMWISEVisual Encoder=Hiera-B, Text Encoder=CLIP-B, Total Params=150 M2024.11 | 68.5 | 65.6 | 71.5 | |
| SAMWISETotal Params=150M2026.06 | 68.5 | 65.6 | 71.5 | |
| MUTRReference=AAAI'242025.01 | 68 | 64.8 | 71.3 | |
| VideoLISA-3.8BTraining=One-Token-Seg-All, Year=20242024.09 | 67.7 | 63.8 | 71.5 | |
| VideoLISA2024.07 | 67.7 | 63.8 | 71.5 | |
| One-Token-Seg-AllVisual Encoder=ViT-H, Text Encoder=Phi-3, Total Params=3.8 B2024.11 | 67.7 | 63.8 | 71.5 | |
| One-Token-Seg-AllTotal Params=3.8B2026.06 | 67.7 | 63.8 | 71.5 | |
| G-DINO-DHBackbone=Swin-B2025.01 | 67.6 | 63.6 | 71.3 | |
| SSATotal Params=474M2026.06 | 67.3 | 64 | 70.7 | |
| VISA-13BTotal Params=13B2026.06 | 67 | 73.8 | 70.4 | |
| ReferDINOBackbone=Swin-T2025.01 | 66.7 | 62.9 | 70.7 | |
| UNINEXTBackbone=ConvNext-L2023.03 | 66.7 | 62.3 | 71.1 | |
| UNINEXTBackbone=ConvNeXt-L2024.11 | 66.7 | — | — | |
| PixelLM2024.07 | 66.7 | 63.4 | 70 | |
| TrackGPT-13BYear=2023, Processing=online2023.12 | 66.5 | 62.7 | 70.4 | |
| TrackGPTBackbone=LLaVA-13B2024.07 | 66.5 | 62.7 | 70.4 | |
| TrackGPTModel Size=13B, Year=20232024.09 | 66.5 | 62.7 | 70.4 | |
| MUTRVisual Encoder=V-Swin-B, Text Encoder=RoBERTa, Total Params=250 M2024.11 | 66.4 | 62.8 | 70 | |
| GroundingDINO+SAM2Visual Encoder=Hiera-B, Text Encoder=BERT, Total Params=240 M2024.11 | 66.4 | 62.8 | 69.9 | |
| MUTRTotal Params=250M2026.06 | 66.4 | 62.8 | 70 | |
| GroundingDINOTotal Params=240M, Evaluation integration=SAM22026.06 | 66.4 | 62.8 | 69.9 | |
| LISABackbone=LLaVA-13B2024.07 | 66 | 63.2 | 68.8 | |
| LISA2024.07 | 66 | 63.2 | 68.8 | |
| HTRBackbone=Swin-L, Pre-training (RefCOCO/g/+)=true2024.03 | 65.6 | 62.3 | 68.8 | |
| EVIS†Reference=-, Backbone=Swin-T2026.06 | 65.6 | 62 | 69.2 | |
| VATEX2024.04 | 65.4 | 62.3 | 68.5 | |
| G-DINO-SHBackbone=Swin-B2025.01 | 65.2 | 61.6 | 68.8 | |
| G-DINO-DHBackbone=Swin-T2025.01 | 65.1 | 61.3 | 69.1 | |
| DsHmpBackbone=Swin-B2025.01 | 64.9 | 61.7 | 68.1 | |
| DsHmpReference=CVPR'242025.01 | 64.9 | 61.7 | 68.1 | |
| DsHmp2024.07 | 64.9 | 61.7 | 68.1 | |
| DsHmpVisual Encoder=V-Swin B, Text Encoder=RoBERTa, Total Params=339 M2024.11 | 64.9 | 61.7 | 68.1 | |
| DsHmpTotal Params=339M2026.06 | 64.9 | 61.7 | 68.1 | |
| OnlineReferYear=2023, Processing=online2023.12 | 64.8 | 61.6 | 67.7 | |
| OnlineReferBackbone=Swin-L2024.07 | 64.8 | 61.6 | 67.7 | |
| LISABackbone=LLaVA-7B2024.07 | 64.8 | 62.2 | 67.3 | |
| OnlineReferYear=20232024.09 | 64.8 | 61.6 | 67.7 | |
| S-HTRBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true2024.03 | 64.8 | 61.8 | 67.9 | |
| OnlineReferBackbone=Swin-L, Pre-training (RefCOCO/g/+)=true2024.03 | 64.8 | 61.6 | 67.7 | |
| OnlineReferBackbone=Swin-L2024.11 | 64.8 | — | — | |
| LISA-7BBackbone=ViT-H2024.11 | 64.8 | — | — | |
| LISAVisual Encoder=ViT-H, Text Encoder=LLaVa, Total Params=7 B2024.11 | 64.8 | 62.2 | 67.3 | |
| OnlineReferVisual Encoder=Swin-L, Text Encoder=RoBERTa, Total Params=232 M2024.11 | 64.8 | 61.6 | 67.7 | |
| LISATotal Params=7B2026.06 | 64.8 | 62.2 | 67.3 | |
| OnlineReferTotal Params=232M2026.06 | 64.8 | 61.6 | 67.7 | |
| TempCDReference=ICCV'232025.01 | 64.6 | 61.6 | 67.6 | |
| LoShBackbone=Swin-B2025.01 | 64.3 | 61.8 | 66.8 | |
| LoShReference=CVPR'242025.01 | 64.3 | 61.8 | 66.8 | |
| SOCBackbone=Swin-B2025.01 | 64.2 | 61 | 67.4 | |
| SOCReference=NIPS'232025.01 | 64.2 | 61 | 67.4 | |
| SOCBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true, Number of queries=20, Number of epochs=302024.03 | 64.2 | 61 | 67.4 | |
| SOCVisual Encoder=V-Swin-B, Text Encoder=RoBERTa, Total Params=220 M2024.11 | 64.2 | 61 | 67.4 | |
| SOCTotal Params=220M2026.06 | 64.2 | 61 | 67.4 | |
| DsHmpBackbone=Swin-T2025.01 | 64 | 60.8 | 67.2 | |
| DsHmpReference=CVPR’24, Backbone=Swin-T/Video-Swin-T2026.06 | 64 | 60.8 | 67.2 | |
| UNINEXTBackbone=ResNet-502023.03 | 63.9 | 59.6 | 68.1 | |
| SOCBackbone=Swin-T2025.01 | 63.5 | 60.2 | 66.7 | |
| SOCBackbone=VideoSwin-T, Pre-training (RefCOCO/g/+)=true, Number of queries=20, Number of epochs=302024.03 | 63.5 | 60.2 | 66.7 | |
| HTRBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true2024.03 | 63.5 | 60.5 | 66.6 | |
| SOCReference=NeurIPS’23, Backbone=Video-Swin-T2026.06 | 63.5 | 60.2 | 66.7 | |
| SgMgBackbone=Swin-B2025.01 | 63.3 | 60.6 | 66 | |
| SgMgReference=ICCV'232025.01 | 63.3 | 60.6 | 66 | |
| SgMgYear=2023, Processing=offline2023.12 | 63.3 | 60.6 | 66 | |
| SgMgYear=20232024.09 | 63.3 | 60.6 | 66 | |
| SgMgBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true2024.03 | 63.3 | 60.6 | 66 | |
| TrackGPT-7BYear=2023, Processing=online2023.12 | 63.2 | 59.4 | 67 | |
| TrackGPTBackbone=LLaVA-7B2024.07 | 63.2 | 59.4 | 67 | |
| TrackGPTModel Size=7B, Year=20232024.09 | 63.2 | 59.4 | 67 | |
| HTRBackbone=VideoSwin-T, Pre-training (RefCOCO/g/+)=true2024.03 | 63.2 | 59.4 | 67 | |
| TrackGPT-7BReference=arXiv’23, Backbone=LLaVA-7B2026.06 | 63.2 | 59.4 | 67 | |
| LoShBackbone=Swin-T2025.01 | 62.9 | 60.1 | 65.7 | |
| LoShReference=CVPR’24, Backbone=Swin-T2026.06 | 62.9 | 60.1 | 65.7 | |
| OnlineReferReference=ICCV'232025.01 | 62.4 | 59.1 | 65.6 | |
| OnlineReferYear=2023, Processing=semi-online2023.12 | 62.4 | 59.1 | 65.6 | |
| OnlineReferBackbone=VideoSwin-B, Pre-training (RefCOCO/g/+)=true2024.03 | 62.4 | 59.1 | 65.6 | |
| OnlineRefer2024.07 | 62.4 | 59.1 | 65.6 | |
| OnlineReferReference=ICCV’23, Backbone=Swin-B2026.06 | 62.4 | 59.1 | 65.6 | |
| DMFormerBackbone=Swin-L, Pre-training (RefCOCO/g/+)=true2024.03 | 62.3 | 59.5 | 65.1 |