Speech-Sound Event Separation on VCTK + FSD-Kaggle 1 Speech + 1 Sound 2018
18.22SI-SDRTF-Locoformer
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TF-LocoformerLearning Paradigm=Supervised2025.12 | 18.22 | 2.37 | |
| UnasDiffLearning Paradigm=Unsupervised, Strategy=Gradient+Initialization, Proposed schedule=γ(t)2025.12 | 14.31 | 2.12 | |
| Conv-TasNetLearning Paradigm=Supervised2025.12 | 14.22 | 1.97 | |
| DSG’s σ(t)-prop. γ(t)Learning Paradigm=Unsupervised, Strategy=Gradient+Initialization2025.12 | 12.97 | 1.94 | |
| DPS’s constant γ(t)Learning Paradigm=Unsupervised, Strategy=Gradient+Initialization2025.12 | 8.88 | 1.73 | |
| Analytical SamplingLearning Paradigm=Unsupervised, Strategy=Analytical Sampling2025.12 | 7.33 | 1.45 | |
| UnprocessedLearning Paradigm=Baseline2025.12 | 0 | 1.64 |