Referring Video Segmentation on MeViS
73.1J&F ScoreAgentRVOS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AgentRVOSMLLM=GPT-5, Training Protocol=Training-free Methods2026.03 | 73.1 | 70.4 | 75.7 | |
| AgentRVOSMLLM=Qwen3-VL-32B-T, Training Protocol=Training-free Methods2026.03 | 67.7 | 65.3 | 70 | |
| AgentRVOSMLLM=Qwen3-VL-8B-T, Training Protocol=Training-free Methods2026.03 | 61.9 | 59.2 | 64.5 | |
| VideoSeg-R1MLLM=Qwen2.5-VL-7B, Training Protocol=Training-based Methods2026.03 | 55.3 | 52.7 | 57.8 | |
| RCoT-SegMLLM=Qwen2.5-VL-3B2026.05 | 53.7 | 50.7 | 56.7 | |
| SteerSegLVLM=Qwen2VL-7B2026.05 | 53.1 | 49.4 | 56.8 | |
| CoT-RVSMLLM=GPT-4o, Training Protocol=Training-free Methods2026.03 | 52.2 | 48.7 | 55.7 | |
| Veason-R1LVLM=Qwen2.5VL-7B2026.05 | 52.2 | 48.4 | 56 | |
| SteerSegLVLM=Qwen2.5VL-7B2026.05 | 51.5 | 47.8 | 55.2 | |
| GLUSMLLM=LISA-7B, Training Protocol=Training-based Methods2026.03 | 51.3 | 48.5 | 54.2 | |
| GLUS-7BMLLM=LLaVA-7B2026.05 | 51.3 | 48.5 | 54.2 | |
| GLUSLVLM=LLaVA-7B2026.05 | 51.3 | 48.5 | 54.2 | |
| Veason-R1-3BMLLM=Qwen2.5-VL-3B2026.05 | 51.2 | 48.2 | 54.2 | |
| VRS-HQMLLM=Chat-UniVi-13B, Training Protocol=Training-based Methods2026.03 | 50.9 | 48 | 53.7 | |
| VRS-HQ-13BMLLM=Chat-UniVi-13B2026.05 | 50.9 | 48 | 53.7 | |
| VRS-HQLVLM=Chat-UniVi-7B2026.05 | 50.6 | 47.6 | 53.7 | |
| RGA3MLLM=Qwen2.5-VL-7B, Training Protocol=Training-based Methods2026.03 | 50.1 | 47.4 | 52.8 | |
| SAMWISEVisual Encoder=Hiera-B, Text Encoder=RoBERTa, Total Params=202 M2024.11 | 49.5 | 46.6 | 52.4 | |
| ViLLa2024.07 | 49.4 | 46.5 | 52.3 | |
| ViLLaMLLM=InternVideo2-6B, Training Protocol=Training-based Methods2026.03 | 49.4 | 46.5 | 52.3 | |
| ReferDINOBackbone=Video-Swin-B/Swin-B2025.01 | 49.3 | 44.7 | 53.9 | |
| ReferDINOBackbone=GroundingDINO-B2026.03 | 49.3 | 44.7 | 53.9 | |
| TrajSegBackbone=LLaVA-7B2026.03 | 48.7 | 45.8 | 51.6 | |
| SSABackbone=CLIP-B2026.03 | 48.6 | 44 | 53.2 | |
| SAMWISEVisual Encoder=Hiera-B, Text Encoder=CLIP-B, Total Params=150 M2024.11 | 48.3 | 45.4 | 51.2 | |
| SteerSegLVLM=InternVL3-8B2026.05 | 48.2 | 43.8 | 52.5 | |
| DecAF*LVLM=Qwen2.5VL-7B2026.05 | 48.1 | 44 | 52.1 | |
| ReferDINOBackbone=Video-Swin-T/Swin-T2025.01 | 48 | 43.6 | 52.3 | |
| G-DINO-DHBackbone=Video-Swin-B/Swin-B2025.01 | 47.9 | 44.3 | 51.5 | |
| SteerSegLVLM=LLaVA-OV-7B2026.05 | 47.8 | 43.8 | 51.9 | |
| VideoChat-TPO2024.12 | 47 | 42.6 | 51.3 | |
| Sa2VAMLLM=InternVL2-8B, Training Protocol=Training-based Methods2026.03 | 46.9 | — | — | |
| DsHmpBackbone=Video-Swin-T/Swin-T2025.01 | 46.4 | 43 | 49.8 | |
| DsHmp2024.07 | 46.4 | 43 | 49.8 | |
| DsHmpVisual Encoder=Swin-T, Text Encoder=RoBERTa, Total Params=272 M2024.11 | 46.4 | 43 | 49.8 | |
| DsHmpBackbone=Video-Swin-B2026.03 | 46.4 | 43 | 49.8 | |
| G-DINO-DHBackbone=Video-Swin-T/Swin-T2025.01 | 45.4 | 41.9 | 48.9 | |
| VideoGLaMM2024.11 | 45.15 | 42.07 | 48.23 | |
| G-DINO-SHBackbone=Video-Swin-B/Swin-B2025.01 | 45 | 41.3 | 48.9 | |
| VISABackbone=Chat-UniVi-13B2024.07 | 44.5 | 41.8 | 47.1 | |
| VISA2024.07 | 44.5 | 41.8 | 47.1 | |
| VISABackbone=Chat-UniVi-13B2026.03 | 44.5 | 41.8 | 47.1 | |
| VISAMLLM=Chat-UniVi-13B, Training Protocol=Training-based Methods2026.03 | 44.5 | 41.8 | 47.1 | |
| VISA-13BMLLM=Chat-UniVi-13B2026.05 | 44.5 | 41.8 | 47.1 | |
| VISALVLM=Chat-UniVi-7B2026.05 | 44.5 | 41.8 | 47.1 | |
| VideoLISA2024.12 | 44.4 | 41.3 | 47.6 | |
| VideoLISApost-processing=true2024.11 | 44.4 | 41.3 | 47.6 | |
| VideoLISA (p)Backbone=LLaVA-Phi-3.8B2026.03 | 44.4 | 41.3 | 47.6 | |
| VideoLISAMLLM=LLaVA-3.8B, Training Protocol=Training-based Methods2026.03 | 44.4 | 41.3 | 47.6 | |
| VideoLISA-3.8BMLLM=LLaVA-Phi-3-V2026.05 | 44.4 | 41.3 | 47.6 | |
| VideoLISALVLM=LLaVA-Phi-3-V2026.05 | 44.4 | 41.3 | 47.6 | |
| CoT-RVSMLLM=Gemma3-12B, Training Protocol=Training-free Methods2026.03 | 44.2 | 40.3 | 48.1 | |
| VISABackbone=Chat-UniVi-7B2024.07 | 43.5 | 40.7 | 46.3 | |
| VISAVisual Encoder=ViT-H, Text Encoder=Chat-UniVi, Total Params=7 B2024.11 | 43.5 | 40.7 | 46.3 | |
| VISABackbone=Chat-UniVi-7B2026.03 | 43.5 | 40.7 | 46.3 | |
| VISA-7BMLLM=Chat-UniVi-7B2026.05 | 43.5 | 40.7 | 46.3 | |
| G-DINO-SHBackbone=Video-Swin-T/Swin-T2025.01 | 43.4 | 39.8 | 47.1 | |
| AL-Ref-SAM2Backbone=GPT-42026.03 | 42.8 | 39.5 | 46.2 | |
| AL-Ref-SAM2MLLM=GPT-4, Training Protocol=Training-free Methods2026.03 | 42.8 | 39.5 | 46.2 | |
| VideoLISA2024.07 | 42.3 | 39.4 | 45.2 | |
| One-Token-Seg-AllVisual Encoder=ViT-H, Text Encoder=Phi-3, Total Params=3.8 B2024.11 | 42.3 | 39.4 | 45.2 | |
| VideoLISABackbone=LLaVA-Phi-3.8B2026.03 | 42.3 | 39.4 | 45.2 | |
| TrackGPTBackbone=LLaVA-13B2024.07 | 41.2 | 39.2 | 43.1 | |
| TrackGPTBackbone=LLaVA-13B2026.03 | 41.2 | 39.2 | 43.1 | |
| Track-GPT-13BMLLM=LLaVA-13B2026.05 | 41.2 | 39.2 | 43.1 | |
| CoT-RVSMLLM=Qwen3-VL-8B-T, Training Protocol=Training-free Methods, reproduced=true2026.03 | 40.8 | 37.7 | 43.9 | |
| LMPM (MeViS baseline)2024.11 | 40.2 | 37.2 | 34.2 | |
| TrackGPTBackbone=LLaVA-7B2024.07 | 40.1 | 37.6 | 42.6 | |
| TrackGPTBackbone=LLaVA-7B2026.03 | 40.1 | 37.6 | 42.6 | |
| Track-GPT-7BMLLM=LLaVA-7B2026.05 | 40.1 | 37.6 | 42.6 | |
| Loc-Head*LVLM=Qwen2.5VL-7B2026.05 | 39.4 | 35.2 | 43.6 | |
| PixelLM2024.07 | 38.7 | 36.3 | 41.1 | |
| GLaMM + SAM22024.11 | 38.66 | 35.8 | 41.5 | |
| LISABackbone=LLaVA-13B2024.07 | 37.9 | 35.8 | 40 | |
| LISA2024.07 | 37.9 | 35.8 | 40 | |
| VISABackbone=LLaVA-13B2026.03 | 37.9 | 35.8 | 40 | |
| GroundingDINO+SAM2Visual Encoder=Hiera-B, Text Encoder=BERT, Total Params=240 M2024.11 | 37.7 | 34.9 | 40.5 | |
| LMPMBackbone=Video-Swin-T/Swin-T2025.01 | 37.2 | 34.2 | 40.2 | |
| LMPMBackbone=Swin-T2024.07 | 37.2 | 34.2 | 40.2 | |
| LISABackbone=LLaVA-7B2024.07 | 37.2 | 35.1 | 39.4 | |
| LMPM2024.07 | 37.2 | 34.2 | 40.2 | |
| LISAVisual Encoder=ViT-H, Text Encoder=LLaVa, Total Params=7 B2024.11 | 37.2 | 35.1 | 39.4 | |
| LMPMVisual Encoder=Swin-T, Text Encoder=RoBERTa, Total Params=195 M2024.11 | 37.2 | 34.2 | 40.2 | |
| LMPMBackbone=Swin-T2026.03 | 37.2 | 34.2 | 40.2 | |
| VISABackbone=LLaVA-7B2026.03 | 37.2 | 35.1 | 39.4 | |
| OnlineReferVisual Encoder=Swin-L, Text Encoder=RoBERTa, Total Params=232 M2024.11 | 32.3 | 31.5 | 33.1 | |
| ReferFormer2024.12 | 31 | 29.8 | 32.2 | |
| ReferFormerBackbone=Video-Swin-T/Swin-T2025.01 | 31 | 29.8 | 32.2 | |
| ReferFormerBackbone=Video-Swin-B2024.07 | 31 | 29.8 | 32.2 | |
| ReferFormer2024.07 | 31 | 29.8 | 32.2 | |
| ReferFormerVisual Encoder=V-Swin-B, Text Encoder=RoBERTa, Total Params=237 M2024.11 | 31 | 29.8 | 32.2 | |
| ReferFormerBackbone=Video-Swin-B2026.03 | 31 | 29.8 | 32.2 | |
| MTTRBackbone=Video-Swin-T/Swin-T2025.01 | 30 | 28.8 | 31.2 | |
| MTTRBackbone=Video-Swin-T2024.07 | 30 | 28.8 | 31.2 | |
| MTTRVisual Encoder=V-Swin-T, Text Encoder=RoBERTa2024.11 | 30 | 28.8 | 31.2 | |
| MTTRBackbone=Video-Swin-T2026.03 | 30 | 28.8 | 31.2 | |
| LBDTBackbone=ResNet502024.07 | 29.3 | 27.8 | 30.8 | |
| LBDT2024.07 | 29.3 | 27.8 | 30.8 | |
| URVOSBackbone=ResNet502024.07 | 27.8 | 25.7 | 29.9 | |
| URVOS2024.07 | 27.8 | 25.7 | 29.9 |