Audio-Visual Segmentation on VPO-MSMI 1.0 (test)
68.39J & FB ScoreDDESeg
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DDESegVisual Backbone=Trans., Audio Backbone=HTSAT, Trainable Params=103.84M, Input Resolution=224 x 2242025.03 | 68.39 | 62.11 | 74.67 | |
| CPM*Visual Backbone=ResNet50, Audio Backbone=VGGish, Input Resolution=Original2025.03 | 68.07 | 60.55 | 75.58 | |
| DDESegVisual Backbone=Trans., Audio Backbone=VGGish, Trainable Params=103.84M, Input Resolution=224 x 2242025.03 | 67.9 | 61.78 | 74.01 | |
| AVSStoneVisual Backbone=SwinBase, Audio Backbone=VGGish, Trainable Params=114.63M, Input Resolution=224 x 2242025.03 | 58.76 | 50.11 | 67.4 | |
| BiasAVSVisual Backbone=SwinBase, Audio Backbone=VGGish, Trainable Params=107.12M, Input Resolution=224 x 2242025.03 | 57.94 | 49.6 | 66.27 | |
| CAVPVisual Backbone=ResNet50, Audio Backbone=VGGish, Trainable Params=119.79M, Input Resolution=224 x 2242025.03 | 56.48 | 48.18 | 64.78 | |
| AVSegFormerVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish, Trainable Params=186.05M, Input Resolution=224 x 2242025.03 | 49.93 | 47.19 | 52.67 | |
| TPAVIVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish, Trainable Params=101.32M, Input Resolution=224 x 2242025.03 | 43.19 | 40.03 | 46.34 |