Audio-Visual Semantic Segmentation on AVSS
31.9MJ ScoreSelM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SelMVisual Backbone=R50, Audio Backbone=VGGish2026.05 | 31.9 | 37.2 | |
| LightAVSegVisual Backbone=Sea, Audio Backbone=MNetV22026.05 | 30.6 | 36.4 | |
| AVSegFormerVisual Backbone=R50, Audio Backbone=VGGish2026.05 | 24.9 | 29.3 | |
| SelMVisual Backbone=Sea, Audio Backbone=MNetV22026.05 | 20.6 | 26.6 | |
| AVSBenchVisual Backbone=R50, Audio Backbone=VGGish2026.05 | 20.2 | 25.2 | |
| AVSegFormerVisual Backbone=Sea, Audio Backbone=MNetV22026.05 | 15.8 | 18.2 | |
| AVSBenchVisual Backbone=Sea, Audio Backbone=MNetV22026.05 | 10 | 11.7 |