Audio-Visual Segmentation on VPO-SS 1.0 (test)
74.97J & FB ScoreRAVS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| RAVS2025.12 | 74.97 | 68.03 | 81.9 | |
| DDAVSVisual Backbone=MiT-B5, Audio Encoder=HTSAT2025.12 | 74.8 | 67.82 | 81.77 | |
| DDESegVisual Backbone=Trans., Audio Backbone=HTSAT, Trainable Params=103.84M, Input Resolution=224 x 2242025.03 | 74.38 | 67.55 | 81.2 | |
| DDESeg2025.12 | 74.38 | 67.55 | 81.2 | |
| DDESegVisual Backbone=Trans., Audio Backbone=VGGish, Trainable Params=103.84M, Input Resolution=224 x 2242025.03 | 73.78 | 67.02 | 80.54 | |
| CPM*Visual Backbone=ResNet50, Audio Backbone=VGGish, Input Resolution=Original2025.03 | 73.49 | 67.09 | 79.88 | |
| AVSStoneVisual Backbone=SwinBase, Audio Backbone=VGGish, Trainable Params=114.63M, Input Resolution=224 x 2242025.03 | 68.54 | 59.72 | 77.35 | |
| AAVS2025.12 | 68.54 | 59.72 | 77.35 | |
| BiasAVSVisual Backbone=SwinBase, Audio Backbone=VGGish, Trainable Params=107.12M, Input Resolution=224 x 2242025.03 | 67.46 | 59.14 | 75.78 | |
| BiasAVS2025.12 | 67.46 | 59.14 | 75.78 | |
| CAVPVisual Backbone=ResNet50, Audio Backbone=VGGish, Trainable Params=119.79M, Input Resolution=224 x 2242025.03 | 67.02 | 58.81 | 75.23 | |
| CAVP2025.12 | 67.02 | 58.81 | 75.23 | |
| AVSegFormerVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish, Trainable Params=186.05M, Input Resolution=224 x 2242025.03 | 45.94 | 43.81 | 48.06 | |
| AVSegFormer2025.12 | 45.94 | 43.81 | 48.06 | |
| TPAVIVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish, Trainable Params=101.32M, Input Resolution=224 x 2242025.03 | 44.63 | 41.64 | 47.62 | |
| TPAVI2025.12 | 44.63 | 41.64 | 47.62 |