Action-based video object segmentation on ActiSeg-NL Name-20 mask clean
63.8p-mIoUSCE
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| SCENoise Type=Name, Noise Level=20%, Mask Condition=clean, Visual Encoder=ResNet-101, Text Encoder=RoBERTa, Pre-training Checkpoints=Ref-YouTube-VOS2025.09 | 63.8 | 25.3 | 67.3 | 36.9 | 50.4 | 67.4 | |
| Co-teachingNoise Type=Name, Noise Level=20%, Mask Condition=clean, Visual Encoder=ResNet-101, Text Encoder=RoBERTa, Pre-training Checkpoints=Ref-YouTube-VOS2025.09 | 63.2 | 18.5 | 71.1 | 35.2 | 70.3 | 80.9 | |
| APLNoise Type=Name, Noise Level=20%, Mask Condition=clean, Visual Encoder=ResNet-101, Text Encoder=RoBERTa, Pre-training Checkpoints=Ref-YouTube-VOS2025.09 | 62.4 | 25.7 | 67 | 39 | 49.1 | 66.8 | |
| GCENoise Type=Name, Noise Level=20%, Mask Condition=clean, Visual Encoder=ResNet-101, Text Encoder=RoBERTa, Pre-training Checkpoints=Ref-YouTube-VOS2025.09 | 59.1 | 24.1 | 66.8 | 37.2 | 46.9 | 66.3 | |
| ELRNoise Type=Name, Noise Level=20%, Mask Condition=clean, Visual Encoder=ResNet-101, Text Encoder=RoBERTa, Pre-training Checkpoints=Ref-YouTube-VOS2025.09 | 56.2 | 12.2 | 60.6 | 12.3 | 69.3 | 79 | |
| NPNNoise Type=Name, Noise Level=20%, Mask Condition=clean, Visual Encoder=ResNet-101, Text Encoder=RoBERTa, Pre-training Checkpoints=Ref-YouTube-VOS2025.09 | 56.1 | 12.4 | 60.5 | 13.8 | 69.1 | 78.7 |