Referring Audio-Visual Segmentation on Ref-AVS (mix)
68.9Jaccard Index (J)PRIMED
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PRIMEDTask=Ours2026.05 | 68.9 | 72.9 | 70.9 | |
| AURORATask=Ref-AVS2026.05 | 66.5 | 74.6 | 70.1 | |
| Ours AuralSAM2Backbone=Hiera-l2025.06 | 62.43 | 67.78 | 65.11 | |
| TGS-AgentTask=Ref-AVS2026.05 | 61.3 | 70.5 | 65.9 | |
| Ours AuralSAM2Backbone=Hiera-b+2025.06 | 58.31 | 64.64 | 61.48 | |
| Omni-R1Task=Omni-Reasoning2026.05 | 57.2 | 64.2 | 60.7 | |
| SAMA-AVS†Backbone=Hiera-b+, reimplementation=true2025.06 | 55.1 | 61.5 | 58.3 | |
| SAM2-LOVETask=Ref-AVS2026.05 | 55 | 62.1 | 58.5 | |
| SAM2-LOVEBackbone=Hiera-l2025.06 | 55 | 62.1 | 58.5 | |
| OISA-1BTask=Omni-AVS2026.05 | 54.5 | 61.4 | 58 | |
| GAVS†Backbone=Hiera-b+, reimplementation=true2025.06 | 53.6 | 60.2 | 56.9 | |
| Ours SAM (w/ AuralFuser)Backbone=ViT-h2025.06 | 53.09 | 59.1 | 58.85 | |
| TSAMTask=Ref-AVS2026.05 | 49 | 61.6 | 55.3 | |
| TSAMBackbone=ViT-h2025.06 | 49 | 61.6 | 55.3 | |
| VoCaTask=Ref-AVS2026.05 | 46.3 | 66.8 | 56.6 | |
| GroundedSAM2*Backbone=Hiera-b+, utilising SAM's zero-shot capability=true2025.06 | 44.2 | 54 | 49.1 | |
| SAMA-AVSBackbone=ViT-h2025.06 | 43.4 | 56.4 | 49.9 | |
| CrabTask=Ref-AVS2026.05 | 43.1 | 60.5 | 46.2 | |
| EEMCTask=Ref-AVS2026.05 | 41.9 | 58.1 | 50 | |
| EEMCBackbone=Swin-b2025.06 | 41.87 | 58.1 | 50 | |
| AVSegFormerTask=AVS*2026.05 | 34.8 | 48.6 | 41.7 | |
| AVSegFormerBackbone=PVT-v22025.06 | 34.76 | 48.6 | 41.7 | |
| ReferFormerTask=Ref-VOS*2026.05 | 30.9 | 49.5 | 40.2 | |
| GAVSTask=AVS*2026.05 | 29.4 | 49.8 | 39.6 | |
| GAVSBackbone=ViT-h2025.06 | 29.4 | 49.8 | 39.6 | |
| AVSBenchTask=AVS*2026.05 | 27.8 | 52.9 | 40.3 | |
| TPAVIBackbone=PVT-v22025.06 | 27.78 | 52.9 | 40.3 | |
| R2VOSTask=Ref-VOS*2026.05 | 26.5 | 45.4 | 35.9 |