Audio-Visual Semantic Segmentation on AVSBench Semantic (test)
50.1mIoUSSP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SSPAudio-backbone=VGGish, Visual-backbone=Swin-Base2026.01 | 50.1 | 54.5 | |
| AAVSAudio-backbone=VGGish, Visual-backbone=Swin-Base2026.01 | 48.5 | 53.2 | |
| COMBOAudio-backbone=VGGish, Visual-backbone=PVT-v22026.01 | 42.1 | 46.1 | |
| AVS-MambaAudio-backbone=VGGish, Visual-backbone=PVT-v22026.01 | 39.7 | 45.1 | |
| TeSOAudio-backbone=VGGish, Visual-backbone=Swin-Base2026.01 | 38.9 | 45.1 | |
| AVSegFormerAudio-backbone=VGGish, Visual-backbone=PVT-v22026.01 | 36.7 | 42 | |
| CatrAudio-backbone=VGGish, Visual-backbone=PVT-v22026.01 | 32.8 | 38.5 | |
| AVSBenchAudio-backbone=VGGish, Visual-backbone=PVT-v22026.01 | 29.8 | 35.2 |