Action-based Video Object Segmentation on ActiSeg-NL Mask-k=21 noise, clean names v1 (test)
46.7p-mIoUCo-teaching
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Co-teachingVisual Encoder=ResNet-101, Text Encoder=RoBERTa (frozen), loss rank threshold=<=0.95, gradient accumulation=128x, Tk=62025.09 | 46.7 | 18.7 | 59.5 | 45.2 | 58.1 | 79.5 | |
| NPNVisual Encoder=ResNet-101, Text Encoder=RoBERTa (frozen), applying thresholding=true2025.09 | 46.2 | 17.2 | 58.5 | 37 | 58.9 | 78 | |
| APLVisual Encoder=ResNet-101, Text Encoder=RoBERTa (frozen), q=0.72025.09 | 45.7 | 14.3 | 58.4 | 30.3 | 60.8 | 82 | |
| ELRVisual Encoder=ResNet-101, Text Encoder=RoBERTa (frozen), temporal regularization=true2025.09 | 45.2 | 16.3 | 57.4 | 34.2 | 58.4 | 78 | |
| GCEVisual Encoder=ResNet-101, Text Encoder=RoBERTa (frozen), q=0.72025.09 | 44.7 | 12.5 | 57.6 | 22.1 | 60.9 | 79.9 | |
| SCEVisual Encoder=ResNet-101, Text Encoder=RoBERTa (frozen)2025.09 | 44.1 | 12.3 | 55.8 | 24.8 | 60.6 | 80 | |
| PMHMVisual Encoder=ResNet-101, Text Encoder=RoBERTa (frozen), threshold_m=0.20, threshold_e=0.852025.09 | 43.8 | 11 | 56.6 | 20.9 | 61.7 | 80.1 |