Action-based video object segmentation on ActiSeg-NL Name-40, mask clean
63.7p-mIoUSCE
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| SCENoise Type=Name, Noise Level=40%, Mask Condition=clean, Visual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 63.7 | 25.7 | 67.7 | 36.9 | 47.5 | 64.7 | |
| SCEVisual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 63.7 | 25.7 | 67.7 | 36.9 | 47.5 | 64.7 | |
| Co-teachingNoise Type=Name, Noise Level=40%, Mask Condition=clean, Visual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 63 | 17.4 | 70.7 | 29.1 | 70.6 | 81.2 | |
| Co-teachingVisual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 63 | 17.4 | 70.7 | 29.1 | 70.6 | 81.2 | |
| APLNoise Type=Name, Noise Level=40%, Mask Condition=clean, Visual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 62.7 | 23.8 | 65.6 | 35.4 | 47.2 | 65.3 | |
| APLVisual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 62.7 | 23.8 | 65.6 | 35.4 | 47.2 | 65.3 | |
| GCENoise Type=Name, Noise Level=40%, Mask Condition=clean, Visual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 61.3 | 25.1 | 65.4 | 36.9 | 44.9 | 63.6 | |
| GCEVisual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 61.3 | 25.1 | 65.4 | 36.9 | 44.9 | 63.6 | |
| ELRNoise Type=Name, Noise Level=40%, Mask Condition=clean, Visual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 54.7 | 10.1 | 59 | 7.4 | 69.5 | 78.9 | |
| ELRVisual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 54.7 | 10.1 | 59 | 7.4 | 69.5 | 78.9 | |
| NPNNoise Type=Name, Noise Level=40%, Mask Condition=clean, Visual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 53.6 | 10.4 | 56.9 | 8.8 | 68.8 | 76.9 | |
| NPNVisual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 53.6 | 10.4 | 56.9 | 8.8 | 68.8 | 76.9 |