Audio-Visual Segmentation on AVSBench multiple-source V1
75.58MJAuralSAM2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AuralSAM2Backbones (audio & visual)=VGGish Hiera-l2025.06 | 75.58 | 84.12 | |
| AuralSAM2Backbones (audio & visual)=VGGish Hiera-b+2025.06 | 72.04 | 81.46 | |
| GAVSBackbones (audio & visual)=VGGish Hiera-b+, reimplementation=true2025.06 | 68.13 | 79.07 | |
| SAMA-AVSBackbones (audio & visual)=VGGish Hiera-b+, reimplementation=true2025.06 | 67.7 | 78.93 | |
| Step.-StonesBackbones (audio & visual)=VGGish Swin-b2025.06 | 67.3 | 77.6 | |
| SAM (w/ AuralFuser)Backbones (audio & visual)=VGGish ViT-h2025.06 | 65.22 | 79.13 | |
| GAVSBackbones (audio & visual)=VGGish ViT-b2025.06 | 63.7 | 77.4 | |
| SAMA-AVSBackbones (audio & visual)=VGGish ViT-h2025.06 | 63.1 | 69.1 | |
| COMBOBackbones (audio & visual)=VGGish PVT-v2, zero-shot capability=true2025.06 | 59.2 | 71.2 | |
| AVSegFormerBackbones (audio & visual)=VGGish PVT-v22025.06 | 58.4 | 69.3 | |
| AVS-BiGenBackbones (audio & visual)=VGGish PVT-v22025.06 | 55.1 | 66.8 | |
| AL-RefBackbones (audio & visual)=Beats Hiera-l, zero-shot capability=true2025.06 | 48.6 | 53.5 | |
| SAM4AVSBackbones (audio & visual)=VGGish PVT-v2, zero-shot capability=true2025.06 | 41.8 | 47.8 |