Referring Audio-Visual Segmentation on Ref-AVS Seen (test)
4,054mIoUCrab
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CrabVisual Backbone=ViT-L/142025.03 | 4,054 | 0.58 | |
| EEMCVisual Backbone=PVT-v22025.03 | 3,420 | 0.51 | |
| AVSegFormerVisual Backbone=PVT-v22025.03 | 3,347 | 0.47 | |
| GAVSVisual Backbone=PVT-v22025.03 | 2,893 | 0.5 | |
| AVSBenchVisual Backbone=PVT-v22025.03 | 51 | 32.36 |