Audio Reconstruction on Song Describer Dataset (SDD) (test)
12SI-SDRϵar-VAE
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ϵar-VAEDt=1024, d=64, RTF=3252026.05 | 12 | 0.08 | 0.07 | 97.2 | 77.6 | |
| SAME-LDt=4096, d=256, RTF=5612026.05 | 11.9 | 0.081 | 0.057 | 96.6 | 82.2 | |
| SAME-SDt=4096, d=256, RTF=20692026.05 | 9.6 | 0.088 | 0.071 | 95.5 | 66.1 | |
| ACE-Step 1.5Dt=1920, d=64, RTF=2842026.05 | 7 | 0.084 | 0.069 | 93.2 | 76.5 | |
| SAO VAEDt=2048, d=64, RTF=3002026.05 | 6.2 | 0.092 | 0.079 | 92.2 | 73.3 | |
| CoDiCodecDt=4096, d=64, RTF=47, Inference mode=2-step autoregressive2026.05 | 0.3 | 0.096 | 0.096 | 81.7 | — |