Referring Audio-Visual Segmentation on Ref-AVS Unseen (test)
49.54mIoUEEMC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EEMCVisual Backbone=PVT-v22025.03 | 49.54 | 0.65 | |
| CrabVisual Backbone=ViT-L/142025.03 | 45.55 | 0.63 | |
| AVSegFormerVisual Backbone=PVT-v22025.03 | 36.05 | 0.5 | |
| GAVSVisual Backbone=PVT-v22025.03 | 29.82 | 0.5 | |
| AVSBenchVisual Backbone=PVT-v22025.03 | 0.55 | 0.21 |