Referring Audio-Visual Segmentation on Ref-AVS 1.0 (seen)
43.5Jaccard IndexSAM2-LOVE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SAM2-LOVEInput Modality=Audio + Text2025.06 | 43.5 | 51.9 | 47.7 | |
| EEMCInput Modality=Audio + Text2025.06 | 34.2 | 51.3 | 42.8 | |
| AVSegFormerInput Modality=Audio + Text2025.06 | 33.5 | 47 | 40.2 | |
| ReferFormerInput Modality=Text + Audio2025.06 | 31.3 | 50.1 | 40.7 | |
| AVSegFormerInput Modality=Audio2025.06 | 29.2 | 42.3 | 35.7 | |
| GAVSInput Modality=Audio + Text2025.06 | 28.9 | 49.8 | 39.4 | |
| ReferFormerInput Modality=Text2025.06 | 27.4 | 47.7 | 37.5 | |
| R2VOSInput Modality=Text + Audio2025.06 | 25 | 41 | 33 | |
| GAVSInput Modality=Audio2025.06 | 24.8 | 45.5 | 35.2 | |
| AVSBenchInput Modality=Audio + Text2025.06 | 23.2 | 51.1 | 37.2 | |
| R2VOSInput Modality=Text2025.06 | 21.3 | 30.9 | 26.1 | |
| AVSBenchInput Modality=Audio2025.06 | 21.2 | 45.7 | 33.5 |