Action-based Video Object Segmentation on ActiSeg-NL Mask-k=9 name clean 1.0 (test)
60.6p-mIoUCo-teaching
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Co-teachingVisual Encoder=ResNet-101, Text Encoder=RoBERTa, Loss rank=≤ 0.95, Gradient accumulation=128x, Tk=62025.09 | 60.6 | 23.4 | 69.8 | 51.1 | 65.1 | 80.1 | |
| GCEVisual Encoder=ResNet-101, Text Encoder=RoBERTa, q=0.72025.09 | 58.8 | 18.5 | 67.5 | 34.2 | 67.1 | 81.6 | |
| APLVisual Encoder=ResNet-101, Text Encoder=RoBERTa, q=0.72025.09 | 58.8 | 18.7 | 68.4 | 33.9 | 67 | 81.3 | |
| NPNVisual Encoder=ResNet-101, Text Encoder=RoBERTa, Spatial Transforms=disabled, Loss=focal BCE, alpha=0.1, beta=0.22025.09 | 58.8 | 20.6 | 67.5 | 37.1 | 65.4 | 78.6 | |
| SCEVisual Encoder=ResNet-101, Text Encoder=RoBERTa2025.09 | 58.7 | 18.5 | 67.4 | 33.1 | 67 | 81.7 | |
| ELRVisual Encoder=ResNet-101, Text Encoder=RoBERTa, Spatial Transforms=disabled, Loss=focal BCE, beta=0.9, epsilon=10-6, alpha=0.5, gamma=2, lambda=12025.09 | 57.1 | 18.8 | 66 | 32.3 | 64.6 | 78 | |
| PMHMVisual Encoder=ResNet-101, Text Encoder=RoBERTa, tau_m=0.20, tau_e=0.85, lambda_head=0.1, lambda_layer=0.12025.09 | 55.6 | 13.6 | 64.3 | 21.5 | 67.8 | 81.1 |