Audio-visual Segmentation on AVS-Object S4
94.2J&FmDDESEG
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DDESEGVisual Backbone=Transformer-based architecture, Audio Backbone=HTSAT2025.03 | 94.2 | 92.4 | 95.9 | |
| DDESEGVisual Backbone=Transformer-based architecture, Audio Backbone=VGGish2025.03 | 92.7 | 91.8 | 93.5 | |
| DDESEGVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 92 | 90.3 | 92.2 | |
| CAVPVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 90.5 | 87.3 | 93.6 | |
| COMBOVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 88.3 | 84.7 | 91.9 | |
| BiasAVSVisual Backbone=Swin-Base, Audio Backbone=VGGish2025.03 | 88.2 | 83.3 | 93 | |
| CATRVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 87.9 | 84.4 | 91.3 | |
| AVSStoneVisual Backbone=Swin-Base, Audio Backbone=VGGish2025.03 | 87.3 | 83.2 | 91.3 | |
| AVSegFormerVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 86.8 | 83.1 | 90.5 | |
| BAVSVisual Backbone=Swin-Base, Audio Backbone=Beats2025.03 | 86.2 | 82.7 | 89.8 | |
| AVSBGVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 86.1 | 81.7 | 90.4 | |
| ECMVAEVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 85.9 | 81.7 | 90.1 | |
| DiffusionAVSVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 85.7 | 81.4 | 90 | |
| AQFormerVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 85.5 | 81.6 | 89.4 | |
| GAVSVisual Backbone=ViT-Base, Audio Backbone=VGGish2025.03 | 85.1 | 80.1 | 90 | |
| AVSCVisual Backbone=Swin-Base, Audio Backbone=VGGish2025.03 | 85 | 81.3 | 88.6 | |
| QDFormerVisual Backbone=Swin-Tiny, Audio Backbone=VGGish2025.03 | 83.9 | 79.5 | 88.2 | |
| TPAVIVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 83.3 | 78.7 | 87.9 | |
| AUTRVisual Backbone=PVT-V2-B5, Audio Backbone=VGGish2025.03 | 82.1 | 77.6 | 86.5 |