Referring Video Object Segmentation on ReVOS
69.5J&F ScoreSETCON
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SETCON2026.05 | 69.5 | — | — | — | — | |
| FeVOS-R1Backbone=InternVL2.5-4B2026.06 | 62.8 | — | — | 57.8 | 60.3 | |
| Sa2VABackbone=InternVL2.5-4B2026.06 | 62.5 | — | — | 55.6 | 59.1 | |
| VRS-HQBackbone=Chat-UniVi-7B2026.06 | 62.1 | — | — | 56.1 | 59.1 | |
| Sa2VA*Backbone=InternVL2.5-4B2026.06 | 61 | — | — | 55.2 | 58.1 | |
| Sa2VA2026.05 | 60.4 | — | — | — | — | |
| VRS-HQ2026.05 | 59.1 | — | — | — | — | |
| GLUS#Training=additional-SFT2025.04 | 58.3 | 56 | 60.7 | — | — | |
| GLUSBackbone=Chat-UniVi-7B2026.06 | 58.3 | — | — | 51.4 | 54.9 | |
| SDAM2026.05 | 58 | — | — | — | — | |
| VISA-13BModel size=13B2025.04 | 57.4 | 55.6 | 59.1 | — | — | |
| ViLLa2026.05 | 57 | — | — | — | — | |
| GLUS2026.05 | 54.9 | — | — | — | — | |
| InstructSeg2026.05 | 54.5 | — | — | — | — | |
| VISABackbone=LLaVA-7B2026.06 | 51 | — | — | 43.2 | 47.1 | |
| VISA-7BModel size=7B2025.04 | 50.9 | 49.2 | 52.6 | — | — | |
| VISA2026.05 | 50.9 | — | — | — | — | |
| VISABackbone=Chat-UniVi-7B2026.06 | 50.9 | — | — | 43 | 46.9 | |
| LISABackbone=LLaVA-7B2026.06 | 45.7 | — | — | 36.1 | 40.9 | |
| TrackGPT2026.05 | 45 | — | — | — | — | |
| LISA2026.05 | 40.9 | — | — | — | — | |
| LMPMBackbone=Swin-T2026.06 | 34.1 | — | — | 18.8 | 26.4 | |
| ReferFormerBackbone=Video-Swin-B2026.06 | 32.7 | — | — | 23.4 | 28.1 | |
| ReferFormer2026.05 | 28.1 | — | — | — | — | |
| LMPM2026.05 | 26.4 | — | — | — | — | |
| ReferFormerBackbone=ResNet502026.06 | 16.9 | — | — | 12.8 | 14.9 |