Referring Video Object Segmentation on RS-RVOS Bench 1.0 (test)
71.2J&FMQC-SAM
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| MQC-SAMVenue=-, Text Encoder=BERT, Visual Encoder=Hiera-L2026.01 | 71.2 | 50.6 | 54.1 | 91.8 | 95.2 | |
| ReferDINOVenue=ICCV 2025, Text Encoder=BERT, Visual Encoder=Swin-B2026.01 | 56.2 | 30.3 | 21 | 82.1 | 88 | |
| SOCVenue=NeurIPS 2023, Text Encoder=RoBERTa, Visual Encoder=Video-Swin-B2026.01 | 53.9 | 34.8 | 26.7 | 73 | 76.1 | |
| ReferFormerVenue=CVPR 2022, Text Encoder=RoBERTa, Visual Encoder=Video-Swin-B2026.01 | 52.6 | 29.6 | 19.6 | 75.6 | 81.1 | |
| ReferDINOVenue=ICCV 2025, Text Encoder=BERT, Visual Encoder=Swin-T2026.01 | 51.9 | 28.5 | 21.5 | 75.3 | 80.5 | |
| SAMWISEVenue=CVPR 2025, Text Encoder=RoBERT, Visual Encoder=Hiera-L2026.01 | 48.1 | 31.7 | 30.6 | 64.5 | 68.2 | |
| OnlineReferVenue=ICCV 2023, Text Encoder=RoBERTa, Visual Encoder=Swin-B2026.01 | 32.4 | 14.9 | 8.3 | 50 | 55.1 | |
| VISAVenue=ECCV 2024, Text Encoder=Chat-UniVi-7B, Visual Encoder=ViT-H2026.01 | 21.5 | 11.8 | 1.4 | 31.2 | 24.1 |