Text-to-Audio Generation on FSD50K
25.97FDBaseline
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| BaselineModel=AudioLDM22026.03 | 25.97 | 1.88 | 7.41 | 0.29 | — | 14.85 | |
| SoundWeaverModel=AudioLDM2, Cache Type=real-audio cache2026.03 | 26.92 | 1.88 | 7.24 | 0.32 | 0.6 | 6.59 | |
| SoundWeaverModel=AudioLDM, Cache Type=real-audio cache2026.03 | 28.83 | 1.83 | 5.71 | 0.36 | 0.57 | 4.37 | |
| SoundWeaver (w/o SG)Model=AudioLDM, Cache Type=real-audio cache, Ablation=Skip Gater2026.03 | 29.37 | 1.82 | 5.49 | 0.35 | — | 4.36 | |
| SoundWeaverModel=AudioLDM2, Cache Type=synthetic-audio cache2026.03 | 31.15 | 2.1 | 6.24 | 0.31 | 0.43 | 6.21 | |
| SoundWeaver (w/o RS)Model=AudioLDM, Cache Type=real-audio cache, Ablation=Reference Selector2026.03 | 32.34 | 1.93 | 5.52 | 0.35 | — | 4.42 | |
| SoundWeaverModel=AudioLDM, Cache Type=synthetic-audio cache2026.03 | 34.81 | 2.05 | 5.1 | 0.33 | 0.48 | 4.5 | |
| BaselineModel=AudioLDM2026.03 | 39.78 | 2.04 | 5.15 | 0.32 | — | 7.93 |