Text-to-audio on AudioCaps
1.86FD (OpenL3)AudioLDM 2
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AudioLDM 22026.05 | 1.86 | 1.64 | — | — | — | — | — | — | — | — | — | — | — | |
| Self-adaptive timestep samplingbase_model=Uniform baseline, sampling_strategy=Self-adaptive timestep2026.05 | 1.91 | 1.04 | 0.62 | 10.92 | — | — | — | — | — | — | — | — | — | |
| Make-an-Audio 22026.05 | 2.05 | 1.27 | — | — | — | — | — | — | — | — | — | — | — | |
| Decayed SSL guidancebase_model=Uniform baseline, guidance_type=Decayed SSL2026.05 | 2.08 | 1.04 | 0.59 | 10.67 | — | — | — | — | — | — | — | — | — | |
| Structure-aware regularizationbase_model=Uniform baseline, regularization=Structure-aware2026.05 | 2.12 | 1.06 | 0.62 | 10.16 | — | — | — | — | — | — | — | — | — | |
| Uniform baselinesampling_strategy=Uniform2026.05 | 2.36 | 1.08 | 0.59 | 9.61 | — | — | — | — | — | — | — | — | — | |
| Tango 22026.05 | 2.69 | 1.12 | 0.57 | 9.09 | — | — | — | — | — | — | — | — | — | |
| AudioX-BaseTask=T2A2026.06 | 11.81 | — | — | 12.46 | 1.29 | 1.65 | 3.2 | 5.65 | 0.27 | — | — | — | — | |
| Tango 2Task=T2A2026.06 | 12.22 | — | — | 10.37 | 1.11 | 3.2 | 3.63 | 5.84 | 0.36 | — | — | — | — | |
| AudioX-TurboTask=T2A2026.06 | 12.29 | — | — | 12.37 | 1.33 | 1.68 | 3.5 | 5.65 | 0.29 | — | — | — | — | |
| MMAudioTask=T2A2026.06 | 12.63 | — | — | 12.03 | 1.35 | 4.71 | 3.06 | 5.64 | 0.3 | — | — | — | — | |
| AudioGenTask=T2A2026.06 | 13.29 | — | — | 10.22 | 1.39 | 1.72 | 3.26 | 5.25 | 0.27 | — | — | — | — | |
| Auffusion-full (Teacher)Type=Multi-step, Duration (h)=1,990, #Queries=2002026.06 | 22.49 | 1.43 | — | 10.42 | — | 1.91 | — | — | — | — | — | 4.06 | 4.1 | |
| SwiftAudioType=One-step, Duration (h)=None, #Queries=12026.06 | 22.73 | 1.62 | — | 9.13 | — | 2.25 | — | — | — | — | — | 3.9 | 3.87 | |
| AudioLCMType=One-step, Duration (h)=110, #Queries=12026.06 | 23.15 | 1.75 | — | 5.81 | — | 2.92 | — | — | — | — | — | 3.26 | 3.55 | |
| AudioLDM2Type=Multi-step, Duration (h)=29,510, #Queries=2002026.06 | 23.42 | 1.68 | — | 9.52 | — | 1.87 | — | — | — | — | — | 3.77 | 3.68 | |
| MAGNET-largeTask=T2A2026.06 | 24.88 | — | — | 7.46 | 1.62 | 2.99 | 3.25 | 5.15 | 0.15 | — | — | — | — | |
| ConsistencyTTAType=One-step, Duration (h)=110, #Queries=12026.06 | 25.68 | 1.42 | — | 9.26 | — | 3.37 | — | — | — | — | — | 3.74 | 3.94 | |
| AudioLDM-2-LargeTask=T2A2026.06 | 26.34 | — | — | 8.46 | 1.49 | 1.97 | 2.86 | 5.77 | 0.22 | — | — | — | — | |
| Stable Audio OpenTask=T2A2026.06 | 29.01 | — | — | 10.37 | 2.01 | 3.15 | 2.77 | 6.16 | 0.21 | — | — | — | — | |
| AudioLDM-L-FullTask=T2A2026.06 | 37.27 | — | — | 6.51 | 2 | 8.37 | 2.82 | 5.67 | 0.2 | — | — | — | — | |
| F3-Tokenizer-LLM (4B)Token rate=25→12.5 Hz2026.06 | 62.7 | 1.52 | 0.438 | — | — | — | — | — | — | — | — | — | — | |
| Ming-omni-tts-16.8B-A3BToken rate=12.5→3.1 Hz2026.06 | 65.918 | 1.64 | 0.424 | — | — | — | — | — | — | — | — | — | — | |
| AudioLDM2Params=346M, NFE=2002026.02 | 72.04 | 1.66 | 0.409 | 7.79 | — | — | — | — | — | — | — | — | — | |
| MOVAParams=1.3B, NFE=1002026.02 | 72.25 | 1.47 | 0.463 | 10.54 | — | — | — | — | — | — | — | — | — | |
| Ming-omni-tts-0.5BToken rate=12.5→3.1 Hz2026.06 | 74.292 | 2.257 | 0.347 | — | — | — | — | — | — | — | — | — | — | |
| TangoFLUXParams=516M, NFE=502026.02 | 80.47 | 1.02 | 0.546 | 13.28 | — | — | — | — | — | — | — | — | — | |
| AudioCALMModel category=Unified baseline2026.06 | — | — | 0.37 | — | — | 1.95 | — | — | — | 3.98 | 3.95 | — | — | |
| AudioLDM 2-LargeModel category=Modality-specific baseline2026.06 | — | — | 0.22 | — | — | 5.36 | — | — | — | 3.25 | 3.1 | — | — | |
| Ming-omniModel category=Unified baseline2026.06 | — | — | 0.27 | — | — | 2.46 | — | — | — | 3.85 | 3.6 | — | — | |
| Stable Audio OpenModel category=Modality-specific baseline2026.06 | — | — | 0.25 | — | — | 4.13 | — | — | — | 3.65 | 3.45 | — | — | |
| TangoFluxModel category=Modality-specific baseline2026.06 | — | — | 0.36 | — | — | 2.7 | — | — | — | 3.82 | 3.85 | — | — | |
| UniAudioModel category=Unified baseline2026.06 | — | — | 0.13 | — | — | 6.64 | — | — | — | 3.2 | 2.95 | — | — | |
| UniFlow-AudioModel category=Unified baseline2026.06 | — | — | 0.35 | — | — | 4.22 | — | — | — | 3.62 | 3.8 | — | — |