Audio-Visual Segmentation on VPO-MS 1.0 (test)
74.3J & FB ScoreDDESeg
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DDESegVisual Backbone=Trans., Audio Backbone=HTSAT, Trainable Params=103.84M, Input Resolution=224 x 2242025.03 | 74.3 | 67.64 | 80.96 | |
| DDESegVisual Backbone=Trans., Audio Backbone=VGGish, Trainable Params=103.84M, Input Resolution=224 x 2242025.03 | 73.62 | 67.01 | 80.23 | |
| CPM*Visual Backbone=ResNet50, Audio Backbone=VGGish, Input Resolution=Original2025.03 | 72.91 | 65.91 | 79.9 | |
| AVSStoneVisual Backbone=SwinBase, Audio Backbone=VGGish, Trainable Params=114.63M, Input Resolution=224 x 2242025.03 | 64.26 | 56.23 | 72.29 | |
| BiasAVSVisual Backbone=SwinBase, Audio Backbone=VGGish, Trainable Params=107.12M, Input Resolution=224 x 2242025.03 | 63.42 | 55.61 | 71.23 | |
| CAVPVisual Backbone=ResNet50, Audio Backbone=VGGish, Trainable Params=119.79M, Input Resolution=224 x 2242025.03 | 61.32 | 53.24 | 69.39 | |
| TPAVIVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish, Trainable Params=101.32M, Input Resolution=224 x 2242025.03 | 45.68 | 42.3 | 49.06 | |
| AVSegFormerVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish, Trainable Params=186.05M, Input Resolution=224 x 2242025.03 | 43.72 | 47.3 | 40.14 |