Audio-Visual Segmentation on AVSBench single-source V1
86.62MJ ScoreAuralSAM2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AuralSAM2Backbones (audio & visual)=VGGish Hiera-l2025.06 | 86.62 | 93.34 | |
| AuralSAM2Backbones (audio & visual)=VGGish Hiera-b+2025.06 | 85.01 | 92.16 | |
| SAM (w/ AuralFuser)Backbones (audio & visual)=VGGish ViT-h2025.06 | 84.78 | 91.92 | |
| COMBOBackbones (audio & visual)=VGGish PVT-v2, zero-shot capability=true2025.06 | 84.7 | 91.9 | |
| GAVSBackbones (audio & visual)=VGGish Hiera-b+, reimplementation=true2025.06 | 83.64 | 92.47 | |
| Step.-StonesBackbones (audio & visual)=VGGish Swin-b2025.06 | 83.2 | 91.3 | |
| SAMA-AVSBackbones (audio & visual)=VGGish Hiera-b+, reimplementation=true2025.06 | 82.11 | 90.58 | |
| AVSegFormerBackbones (audio & visual)=VGGish PVT-v22025.06 | 82.1 | 89.9 | |
| AVS-BiGenBackbones (audio & visual)=VGGish PVT-v22025.06 | 81.7 | 90.4 | |
| SAMA-AVSBackbones (audio & visual)=VGGish ViT-h2025.06 | 81.5 | 88.6 | |
| GAVSBackbones (audio & visual)=VGGish ViT-b2025.06 | 80.1 | 90.2 | |
| AL-RefBackbones (audio & visual)=Beats Hiera-l, zero-shot capability=true2025.06 | 70.5 | 81.1 | |
| SAM4AVSBackbones (audio & visual)=VGGish PVT-v2, zero-shot capability=true2025.06 | 51.2 | 61.5 |