Referring Audio-Visual Segmentation on Ref-AVS
4,054Seen ScoreCrab
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CrabBackbone=ViT/L-142025.03 | 4,054 | 4,555 | 1 | |
| EEMCBackbone=PVT-v22025.03 | 3,420 | 4,954 | 1 | |
| AVSegFormerBackbone=PVT-v22025.03 | 3,347 | 3,605 | 17 | |
| GAVSBackbone=PVT-v22025.03 | 2,893 | 2,982 | 19 | |
| AVSBenchBackbone=ResNet-502025.03 | 51 | 55 | 21 | |
| GroundedSAM2*Backbone=Hiera-b+, utilising SAM's zero-shot capability=true2025.06 | 27.7 | — | — | |
| SAM2-LOVETask=Ref-AVS2026.05 | 23 | — | — | |
| SAM2-LOVEBackbone=Hiera-l2025.06 | 23 | — | — | |
| AVSBenchTask=AVS*2026.05 | 20.8 | — | — | |
| TPAVIBackbone=PVT-v22025.06 | 20.8 | — | — | |
| GAVSTask=AVS*2026.05 | 19 | — | — | |
| GAVSBackbone=ViT-h2025.06 | 19 | — | — | |
| R2VOSTask=Ref-VOS*2026.05 | 18.3 | — | — | |
| ReferFormerTask=Ref-VOS*2026.05 | 17.6 | — | — | |
| AVSegFormerTask=AVS*2026.05 | 17.1 | — | — | |
| AVSegFormerBackbone=PVT-v22025.06 | 17.1 | — | — | |
| SAMA-AVSBackbone=ViT-h2025.06 | 13 | — | — | |
| Ours AuralSAM2Backbone=Hiera-b+2025.06 | 12.9 | — | — | |
| SAMA-AVS†Backbone=Hiera-b+, reimplementation=true2025.06 | 10.3 | — | — | |
| OISA-1BTask=Omni-AVS2026.05 | 9.8 | — | — | |
| GAVS†Backbone=Hiera-b+, reimplementation=true2025.06 | 7.6 | — | — | |
| Ours AuralSAM2Backbone=Hiera-l2025.06 | 6.5 | — | — | |
| Ours SAM (w/ AuralFuser)Backbone=ViT-h2025.06 | 5.3 | — | — | |
| TGS-AgentTask=Ref-AVS2026.05 | 3.5 | — | — | |
| TSAMTask=Ref-AVS2026.05 | 1.7 | — | — | |
| TSAMBackbone=ViT-h2025.06 | 1.7 | — | — | |
| PRIMEDTask=Ours2026.05 | 1.5 | — | — | |
| EEMCTask=Ref-AVS2026.05 | 0.7 | — | — | |
| EEMCBackbone=Swin-b2025.06 | 0.7 | — | — | |
| VoCaTask=Ref-AVS2026.05 | 0.5 | — | — |