Referring Video Object Segmentation on Ref-Youtube-VOS v1.0 (test)
61.3J&F ScoreR2-VOS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| R2-VOSBackbone=V-Swin-T, P (Pre-trained on ref-coco+)=true2022.07 | 61.3 | 59.6 | 63.1 | |
| R2-VOSBackbone=Swin-T, P (Pre-trained on ref-coco+)=false2022.07 | 60.2 | 58.9 | 61.5 | |
| ReferFormerBackbone=V-Swin-T, P (Pre-trained on ref-coco+)=true2022.07 | 59.4 | 58 | 60.9 | |
| ReferFormerBackbone=Swin-T, P (Pre-trained on ref-coco+)=false2022.07 | 58.7 | 57.6 | 59.9 | |
| VISABackbone=LLaVA-13B, Instruction Tuning=true2024.07 | 57.4 | 55.7 | 59 | |
| VISABackbone=Chat-UniVi-13B, Instruction Tuning=true2024.07 | 57.4 | 55.6 | 59.1 | |
| R2-VOSBackbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 57.3 | 56.1 | 58.4 | |
| R2-VOSBackbone=V-Swin-T, P (Pre-trained on ref-coco+)=false2022.07 | 57.1 | 55.9 | 58.2 | |
| CITDBackbone=ResNet101, P (Pre-trained on ref-coco+)=false2022.07 | 56.4 | 54.8 | 58.1 | |
| ReferFormerBackbone=V-Swin-T, P (Pre-trained on ref-coco+)=false2022.07 | 56 | 54.8 | 57.3 | |
| ReferFormerBackbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 55.6 | 54.8 | 56.5 | |
| Chen et al.Backbone=V-Swin-T, P (Pre-trained on ref-coco+)=false2022.07 | 55.6 | 54 | 55.6 | |
| MTTRBackbone=V-Swin-T, P (Pre-trained on ref-coco+)=false2022.07 | 55.3 | 54 | 56.6 | |
| YOFOBackbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 54.4 | 50.1 | 58.7 | |
| VISABackbone=Chat-UniVi-13B, Instruction Tuning=false2024.07 | 54.1 | 52.3 | 55.8 | |
| PMINetBackbone=ResNet101, P (Pre-trained on ref-coco+)=false2022.07 | 53 | 51.5 | 54.5 | |
| VISABackbone=Chat-UniVi-7B, Instruction Tuning=false2024.07 | 52.9 | 51.1 | 54.7 | |
| VISABackbone=LLaVA-7B, Instruction Tuning=true2024.07 | 51 | 49.4 | 52.6 | |
| VISABackbone=Chat-UniVi-7B, Instruction Tuning=true2024.07 | 50.9 | 49.2 | 52.6 | |
| Wu et al.Backbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 49.7 | 48.4 | 51 | |
| TrackGPTBackbone=LLaVA-13B, Instruction Tuning=true, Reproduced=true2024.07 | 49.5 | 48.3 | 50.6 | |
| LBDTBackbone=LBDT, P (Pre-trained on ref-coco+)=false2022.07 | 49.4 | 48.2 | 50.6 | |
| TrackGPTBackbone=LLaVA-7B, Instruction Tuning=true, Reproduced=true2024.07 | 48.2 | 46.7 | 49.7 | |
| URVOSBackbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 47.2 | 45.3 | 49.2 | |
| LISABackbone=LLaVA-13B, Instruction Tuning=false, Reproduced=true2024.07 | 46.6 | 45.2 | 47.9 | |
| LISABackbone=LLaVA-7B, Instruction Tuning=false2024.07 | 45.7 | 44.3 | 47.1 | |
| CMSA + RNNBackbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 36.4 | 34.8 | 38.1 | |
| CMSABackbone=ResNet50, P (Pre-trained on ref-coco+)=false2022.07 | 34.9 | 33.3 | 36.5 | |
| LMPMBackbone=Swin-T, Instruction Tuning=false2024.07 | 34.1 | 29 | 39.1 | |
| LLaMA-VID+LMPMBackbone=Swin-T, Instruction Tuning=false2024.07 | 34.1 | 29 | 39.1 | |
| ReferFormerBackbone=Video-Swin-B, Instruction Tuning=false2024.07 | 32.7 | 31.2 | 34.3 | |
| MTTRBackbone=Video-Swin-T, Instruction Tuning=false2024.07 | 30 | 29.8 | 30.2 | |
| ReferFormerBackbone=ResNet-50, Instruction Tuning=false2024.07 | 16.9 | 16.6 | 17.1 |