Audio-Visual Segmentation on AVSBench semantic V2
50.57MJ ScoreAuralSAM2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AuralSAM2Backbones (audio & visual)=VGGish Hiera-l, grounding_semantic_info=true2025.06 | 50.57 | 56.03 | |
| AuralSAM2Backbones (audio & visual)=VGGish Hiera-b+, grounding_semantic_info=true2025.06 | 50.23 | 55.16 | |
| SAM (w/ AuralFuser)Backbones (audio & visual)=VGGish ViT-h, grounding_semantic_info=true2025.06 | 49.52 | 54.88 | |
| Step.-StonesBackbones (audio & visual)=VGGish Swin-b, grounding_semantic_info=true2025.06 | 48.5 | 53.2 | |
| COMBOBackbones (audio & visual)=VGGish PVT-v2, zero-shot capability=true2025.06 | 42.1 | 46.1 | |
| AVSegFormerBackbones (audio & visual)=VGGish PVT-v22025.06 | 36.7 | 42 | |
| AL-RefBackbones (audio & visual)=Beats Hiera-l, zero-shot capability=true2025.06 | 36 | 39.8 |