Referring Audio-Visual Segmentation on Ref-AVS (unseen)
73.2Jaccard Index (J)TGS-Agent
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TGS-AgentTask=Ref-AVS2026.05 | 73.2 | 80.6 | 76.9 | |
| PRIMEDTask=Ours2026.05 | 71.8 | 74.3 | 73.1 | |
| Omni-R1Task=Omni-Reasoning2026.05 | 71.3 | 77 | 74.2 | |
| AURORATask=Ref-AVS2026.05 | 69.7 | 76.4 | 73 | |
| Ours AuralSAM2Backbone=Hiera-l2025.06 | 68.69 | 74.36 | 71.53 | |
| SAM2-LOVETask=Ref-AVS2026.05 | 66.5 | 72.3 | 69.4 | |
| SAM2-LOVEBackbone=Hiera-l2025.06 | 66.5 | 72.3 | 69.4 | |
| Ours AuralSAM2Backbone=Hiera-b+2025.06 | 63.45 | 70.44 | 66.95 | |
| SAMA-AVS†Backbone=Hiera-b+, reimplementation=true2025.06 | 60.6 | 66.4 | 63.5 | |
| GroundedSAM2*Backbone=Hiera-b+, utilising SAM's zero-shot capability=true2025.06 | 59.8 | 68.1 | 63.9 | |
| GAVS†Backbone=Hiera-b+, reimplementation=true2025.06 | 59.2 | 65.8 | 62.5 | |
| OISA-1BTask=Omni-AVS2026.05 | 58.3 | 65.1 | 61.7 | |
| Ours SAM (w/ AuralFuser)Backbone=ViT-h2025.06 | 57.91 | 68.95 | 63.43 | |
| TSAMTask=Ref-AVS2026.05 | 54.6 | 66.4 | 60.5 | |
| TSAMBackbone=ViT-h2025.06 | 54.6 | 66.4 | 60.5 | |
| VoCaTask=Ref-AVS2026.05 | 51.7 | 70.8 | 61.2 | |
| EEMCBackbone=Swin-b2025.06 | 49.54 | 64.8 | 57.2 | |
| EEMCTask=Ref-AVS2026.05 | 49.5 | 64.8 | 57.2 | |
| SAMA-AVSBackbone=ViT-h2025.06 | 47.5 | 56.6 | 52.1 | |
| CrabTask=Ref-AVS2026.05 | 45.6 | 63 | 54.3 | |
| AVSegFormerTask=AVS*2026.05 | 36.1 | 50.1 | 43.1 | |
| AVSegFormerBackbone=PVT-v22025.06 | 36.05 | 50.1 | 43.1 | |
| AVSBenchTask=AVS*2026.05 | 32.4 | 54.7 | 43.5 | |
| TPAVIBackbone=PVT-v22025.06 | 32.36 | 54.7 | 43.5 | |
| ReferFormerTask=Ref-VOS*2026.05 | 30.4 | 48.8 | 39.6 | |
| GAVSTask=AVS*2026.05 | 29.8 | 49.7 | 39.8 | |
| GAVSBackbone=ViT-h2025.06 | 29.8 | 49.7 | 39.8 | |
| R2VOSTask=Ref-VOS*2026.05 | 27.9 | 49.8 | 38.9 |