Video Referring Segmentation on ReVOS Overall
53.1Jaccard (J)HyperSeg-3B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| HyperSeg-3BBackbone=Swin-B, Pre-trained SAM=false2024.11 | 53.1 | 58.4 | 55.7 | |
| VISA-13BBackbone=ViT-H, Pre-trained SAM=true2024.11 | 45.3 | 49.7 | 47.5 | |
| VISA-7BBackbone=ViT-H, Pre-trained SAM=true2024.11 | 43.9 | 48.2 | 46.1 | |
| TrackGPT-13BBackbone=ViT-H, Pre-trained SAM=true2024.11 | 43.2 | 46.8 | 45 | |
| LISA-7BBackbone=ViT-H, Pre-trained SAM=true2024.11 | 39.1 | 42.7 | 40.9 | |
| ReferFormerBackbone=Video-Swin-B, Pre-trained SAM=false2024.11 | 26.2 | 29.9 | 28.1 | |
| LMPMBackbone=Swin-T, Pre-trained SAM=false2024.11 | 21.2 | 31.7 | 26.4 |