Video Semantic Segmentation on VSPW W2F protocol (10% warm-up ratio)
51.1mIoUDiTTA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DiTTAApproach=ISS+SAM2, FPS=13.452026.04 | 51.1 | 66.5 | 94.1 | 92.2 | |
| TV3SApproach=VSS, FPS=5.712026.04 | 49.8 | 66.4 | 91.5 | 88 | |
| Zero-shot Refine.Approach=ISS+SAM2, FPS=1.412026.04 | 49.7 | 66.5 | 94.7 | 92.9 | |
| CFFM++Approach=VSS, FPS=5.852026.04 | 49.6 | 66.1 | 90.4 | 86.8 | |
| TENTApproach=ISS+TTA, FPS=18.452026.04 | 49.6 | 66.5 | 90.3 | 87.2 | |
| CoTTAApproach=ISS+TTA, FPS=18.482026.04 | 49.6 | 66.7 | 89.7 | 86.4 | |
| CFFMApproach=VSS, FPS=5.982026.04 | 49.4 | 66.5 | 90.8 | 87.3 | |
| SegFormerApproach=ISS, FPS=18.582026.04 | 49 | 66.3 | 88.3 | 84.3 | |
| AuxAdaptApproach=ISS+TTA, FPS=18.562026.04 | 48.7 | 65.5 | 89.4 | 85.9 |