Audio-visual Segmentation on AVS-Semantic (J&Fm, J, Fm)
63.4Jaccard Index (J)DDESEG
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DDESEGVisual Backbone=Transformer-based architecture, Audio Backbone=HTSAT2025.03 | 63.4 | 67.9 | 72.3 | |
| DDESEGVisual Backbone=Transformer-based architecture, Audio Backbone=VGGish2025.03 | 62.3 | 67 | 71.6 | |
| DDESEGVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 60.8 | 65.7 | 70.6 | |
| AVSStoneVisual Backbone=Swin-Base, Audio Backbone=VGGish2025.03 | 56.8 | 61.5 | 66.2 | |
| QDFormerVisual Backbone=Swin-Tiny, Audio Backbone=VGGish2025.03 | 53.4 | — | — | |
| CAVPVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 48.6 | 55.3 | 62 | |
| BiasAVSVisual Backbone=Swin-Base, Audio Backbone=VGGish2025.03 | 44.4 | 47.2 | 49.9 | |
| COMBOVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 42.1 | 44.1 | 46.1 | |
| AVSegFormerVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 37.3 | 40.1 | 42.8 | |
| BAVSVisual Backbone=Swin-Base, Audio Backbone=Beats2025.03 | 33.6 | 35.6 | 37.5 | |
| CATRVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 32.8 | 35.7 | 38.5 | |
| TPAVIVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 29.8 | 32.5 | 35.2 |