Referring Video Object Segmentation on Ref-DAVIS
81.4J&F ScoreSteerSeg
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SteerSegBackbone=Qwen2.5VL-7B, Training Protocol=Frozen-LVLM, Training-free=false2026.05 | 81.4 | 78 | 84.8 | |
| SETCON2026.05 | 80.8 | — | — | |
| SteerSegBackbone=Qwen2VL-7B, Training Protocol=Frozen-LVLM, Training-free=false2026.05 | 77.8 | 74.2 | 81.4 | |
| VRS-HQBackbone=ChatUniVi-7B, Training Protocol=Fully Trained2026.05 | 76 | 72.6 | 79.4 | |
| VRS-HQ2026.05 | 76 | — | — | |
| SDAM2026.05 | 76 | — | — | |
| Sa2VA2026.05 | 75.9 | — | — | |
| DecAF*Backbone=Qwen2.5VL-7B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 75.2 | 70.9 | 79.5 | |
| ViLLa2026.05 | 74.3 | — | — | |
| AL-Ref-SAM2Backbone=GPT-42026.03 | 74.2 | 70.4 | 78 | |
| GLUS2026.05 | 73.9 | — | — | |
| InstructSeg2026.05 | 71.1 | — | — | |
| SAMWISE2026.05 | 70.6 | — | — | |
| VISABackbone=Chat-UniVi-13B2026.03 | 70.4 | 67 | 73.8 | |
| VISA2026.05 | 70.4 | — | — | |
| SteerSegBackbone=LLaVA-OV-7B, Training Protocol=Frozen-LVLM, Training-free=false2026.05 | 70 | 65.7 | 74.3 | |
| TrajSegBackbone=LLaVA-7B2026.03 | 69.6 | 66.4 | 72.9 | |
| VideoGLaMM2026.05 | 69.5 | — | — | |
| VD-ITBackbone=Video Diffusion2026.03 | 69.4 | 66.2 | 72.6 | |
| VISABackbone=Chat-UniVi-7B2026.03 | 69.4 | 66.3 | 72.5 | |
| VISABackbone=ChatUniVi-7B, Training Protocol=Fully Trained2026.05 | 69.4 | 66.3 | 72.5 | |
| ReferDINOBackbone=GroundingDINO-B2026.03 | 68.9 | 65.1 | 72.9 | |
| VideoLISA (p)Backbone=LLaVA-Phi-3.8B2026.03 | 68.8 | 64.9 | 72.7 | |
| VideoLISABackbone=LLaVA-Phi-3-V, Training Protocol=Fully Trained2026.05 | 68.8 | 64.9 | 72.7 | |
| VideoLISA2026.05 | 68.8 | — | — | |
| VideoLISABackbone=LLaVA-Phi-3.8B2026.03 | 67.7 | 63.8 | 71.5 | |
| SSABackbone=CLIP-B2026.03 | 67.3 | 64 | 70.7 | |
| TrackGPTBackbone=LLaVA-13B2026.03 | 66.5 | 62.7 | 70.4 | |
| TrackGPT2026.05 | 66.5 | — | — | |
| Loc-Head*Backbone=InternVL3-8B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 66.3 | 62.4 | 70.2 | |
| SteerSegBackbone=InternVL3-8B, Training Protocol=Frozen-LVLM, Training-free=false2026.05 | 66.1 | 62 | 70.1 | |
| VISABackbone=LLaVA-13B2026.03 | 66 | 63.2 | 68.8 | |
| DMVS2026.05 | 65.2 | — | — | |
| DsHmpBackbone=Video-Swin-B2026.03 | 64.9 | 61.7 | 68.1 | |
| DsHmp2026.05 | 64.9 | — | — | |
| OnlineReferBackbone=Swin-L2024.02 | 64.8 | — | — | |
| OnlineReferBackbone=Swin-L2026.03 | 64.8 | 61.6 | 67.7 | |
| VISABackbone=LLaVA-7B2026.03 | 64.8 | 62.2 | 67.3 | |
| LISABackbone=LLaVA-7B, Training Protocol=Fully Trained2026.05 | 64.8 | 62.2 | 67.3 | |
| OnlineRefer2026.05 | 64.8 | — | — | |
| LISA2026.05 | 64.8 | — | — | |
| Loc-Head*Backbone=Qwen2.5VL-7B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 64.6 | 60.2 | 68.9 | |
| SOC2026.05 | 64.2 | — | — | |
| DecAF*Backbone=Qwen2VL-7B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 64.1 | 59.4 | 68.9 | |
| SgMgBackbone=SwinB2024.02 | 63.3 | — | — | |
| SgMg2026.05 | 63.3 | — | — | |
| TrackGPTBackbone=LLaVA-7B2026.03 | 63.2 | 59.4 | 67 | |
| DecAF*Backbone=InternVL3-8B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 62.8 | 56.9 | 68.6 | |
| HTML2026.05 | 62.1 | — | — | |
| SgMgBackbone=SwinT2024.02 | 61.9 | — | — | |
| Loc-Head*Backbone=Qwen2VL-7B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 61.9 | 58 | 65.8 | |
| ReferFormerBackbone=Video-Swin-B2026.03 | 61.1 | 58.1 | 64.1 | |
| ReferFormer2026.05 | 61.1 | — | — | |
| VLT+TC2026.05 | 60.3 | — | — | |
| DecAF*Backbone=LLaVA-OV-7B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 59.4 | 54.8 | 64 | |
| OnlineReferBackbone=R502024.02 | 59.3 | — | — | |
| ReferFormerBackbone=R502024.02 | 58.5 | — | — | |
| Loc-Head*Backbone=LLaVA-7B, Training Protocol=Frozen-LVLM, Training-free=true2026.05 | 56.3 | 52.1 | 60.5 | |
| LBDT2026.05 | 54.1 | — | — |