Audio-Visual Semantic Segmentation on AVSBench AVSS v1 (test)
51.2MJVCT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VCTBackbone=Swin-B, Image Size=384x3842025.06 | 51.2 | 55.5 | |
| VCTBackbone=Swin-B, Image Size=224x2242025.06 | 47.9 | 52.9 | |
| VCTBackbone=PVT-v2, Image Size=224x2242025.06 | 44.7 | 49.5 | |
| AVSBiasBackbone=Swin-B, Image Size=384x3842025.06 | 44.4 | 49.9 | |
| COMBOBackbone=PVT-v2, Image Size=224x2242025.06 | 42.1 | 46.1 | |
| COMBOBackbone=PVT-v22023.12 | 42.1 | 46.1 | |
| SelMBackbone=PVT-v2, Image Size=224x2242025.06 | 41.3 | 46.9 | |
| TESOBackbone=Swin-B, Image Size=384x3842025.06 | 39 | 45.1 | |
| VCTBackbone=ResNet-50, Image Size=224x2242025.06 | 37.5 | 42.2 | |
| AVSFBackbone=PVT-v2, Image Size=224x2242025.06 | 36.7 | 42 | |
| AVSegFormerBackbone=PVT-v22023.12 | 36.7 | 42 | |
| CPMBackbone=ResNet-50, Image Size=224x2242025.06 | 34.5 | 39.6 | |
| BAVSBackbone=Swin-B, Image Size=224x2242025.06 | 33.6 | 37.5 | |
| COMBOBackbone=ResNet-50, Image Size=224x2242025.06 | 33.3 | 37.3 | |
| COMBOBackbone=ResNet-502023.12 | 33.3 | 37.3 | |
| CATRBackbone=PVT-v2, Image Size=224x2242025.06 | 32.8 | 38.5 | |
| BAVSBackbone=PVT-v2, Image Size=224x2242025.06 | 32.6 | 36.4 | |
| BAVSBackbone=PVT-v22023.12 | 32.6 | 36.4 | |
| SelMBackbone=ResNet-50, Image Size=224x2242025.06 | 31.9 | 37.2 | |
| CAVPBackbone=ResNet-50, Image Size=224x2242025.06 | 30.4 | 35.3 | |
| TPAVIBackbone=PVT-v2, Image Size=224x2242025.06 | 29.8 | 35.2 | |
| AVSBenchBackbone=PVT-v22023.12 | 29.8 | 35.2 | |
| AOTBackbone=ResNet-502023.12 | 25.4 | 31 | |
| AVSFBackbone=ResNet-50, Image Size=224x2242025.06 | 24.9 | 29.3 | |
| AVSegFormerBackbone=ResNet-502023.12 | 24.9 | 29.3 | |
| BAVSBackbone=ResNet-50, Image Size=224x2242025.06 | 24.7 | 29.6 | |
| BAVSBackbone=ResNet-502023.12 | 24.7 | 29.6 | |
| AVSBenchBackbone=ResNet-502023.12 | 20.2 | 25.2 | |
| 3DCBackbone=ResNet-182023.12 | 17.3 | 21.6 |