Audio-Visual Segmentation on AVSBench-object MS3
57.1mIoUMoLT
Evaluation Results
| Method | Links | |
|---|---|---|
| MoLTVisual backbone=Swin-V2-L, Audio backbone=HTS-AT2026.05 | 57.1 | |
| MettleVisual backbone=Swin-V2-L, Audio backbone=HTS-AT2026.05 | 55.1 | |
| AVSVisual backbone=PVT-v2, Audio backbone=VGGish2026.05 | 54 | |
| AVMoEVisual backbone=Swin-V2-L, Audio backbone=HTS-AT2026.05 | 53.4 | |
| TB-AVAVisual backbone=SigLIP2-L/16, Audio backbone=BEATs2026.05 | 53.4 | |
| DG-SCTVisual backbone=Swin-V2-L, Audio backbone=HTS-AT2026.05 | 52.9 | |
| LAVisHVisual backbone=Swin-V2-L (shared), Audio backbone=Swin-V2-L (shared)2026.05 | 49.8 |