Referring Audio-Visual Segmentation on Ref-AVS 1.0 (unseen)
66.5J (Jaccard Index)SAM2-LOVE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SAM2-LOVEInput Modality=Audio + Text2025.06 | 66.5 | 72.3 | 69.4 | |
| EEMCInput Modality=Audio + Text2025.06 | 49.5 | 64.8 | 57.2 | |
| AVSegFormerInput Modality=Audio + Text2025.06 | 36.1 | 50.1 | 43.1 | |
| AVSegFormerInput Modality=Audio2025.06 | 32.7 | 45.1 | 38.9 | |
| AVSBenchInput Modality=Audio + Text2025.06 | 32.4 | 54.7 | 43.5 | |
| ReferFormerInput Modality=Text + Audio2025.06 | 30.4 | 48.8 | 39.6 | |
| GAVSInput Modality=Audio + Text2025.06 | 29.8 | 49.7 | 39.8 | |
| R2VOSInput Modality=Text + Audio2025.06 | 27.9 | 49.8 | 38.9 | |
| GAVSInput Modality=Audio2025.06 | 27.8 | 46 | 36.9 | |
| AVSBenchInput Modality=Audio2025.06 | 27.7 | 50.9 | 39.3 | |
| ReferFormerInput Modality=Text2025.06 | 24.9 | 50.4 | 37.6 | |
| R2VOSInput Modality=Text2025.06 | 23.9 | 43.1 | 33.5 |