Speech-Sound Event Separation on VCTK + FSD-Kaggle2018 1 Speech + 2 Sound
12.21SI-SDRTF-Locoformer
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TF-LocoformerLearning Paradigm=Supervised2025.12 | 12.21 | 1.95 | |
| UnasDiffLearning Paradigm=Unsupervised, Strategy=Gradient+Initialization2025.12 | 8.58 | 1.8 | |
| DSG’s σ(t)-prop. γ(t)Learning Paradigm=Unsupervised, Strategy=Gradient+Initialization2025.12 | 7.96 | 1.72 | |
| Conv-TasNetLearning Paradigm=Supervised2025.12 | 7.05 | 1.43 | |
| DPS’s constant γ(t)Learning Paradigm=Unsupervised, Strategy=Gradient+Initialization2025.12 | 3.02 | 1.56 | |
| Analytical SamplingLearning Paradigm=Unsupervised, Strategy=Analytical Sampling2025.12 | -0.04 | 1.19 | |
| Unprocessed2025.12 | -3.15 | 1.22 |