Text-to-audio generation on AudioCaps (evaluation)
1.85FADRe-AudioLDM
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Re-AudioLDMTraining Dataset=AudioCaps2025.09 | 1.85 | 1.46 | 49.9 | 62 | |
| DreamAudioTraining Dataset=AudioCaps, Strategy=training from scratch2025.09 | 1.9 | 1.5 | 50.8 | 62.5 | |
| DreamAudioTraining Dataset=AudioCaps, Strategy=fine-tuning2025.09 | 1.92 | 1.51 | 47.5 | 58.8 | |
| TangoTraining Dataset=AudioCaps2025.09 | 2.24 | 1.04 | 51.7 | 66.2 | |
| TangoFluxTraining Dataset=WavCaps+2 others2025.09 | 2.33 | 1.09 | 50.4 | 59.5 | |
| Make-an-AudioTraining Dataset=AC+AS+13 others2025.09 | 2.39 | 1.64 | 45.4 | 59.8 | |
| AudioLDM2Training Dataset=AC+AS+6 others2025.09 | 2.56 | 1.75 | 45.8 | 55.5 | |
| AudioGenTraining Dataset=AC+AS+8 others2025.09 | 2.87 | 1.52 | 46.4 | 60.2 | |
| Stable Audio OpenTraining Dataset=FreeSound2025.09 | 4.05 | 2.11 | 44.9 | 55.2 | |
| DreamAudioTraining Dataset=AC+CC+CO2025.09 | 4.25 | 2.48 | 34.9 | 43.6 | |
| AudioLDMTraining Dataset=AC+AS+2 others2025.09 | 5.25 | 1.9 | 42.1 | 53.5 |