Text-to-audio generation on AudioCaps (test)
0KL DivergenceGround Truth
Evaluation Results
| Method | Links | ||||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Ground Truth2026.04 | 0 | — | — | 0 | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GT2026.05 | 0 | — | — | — | — | — | 53 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 0 | 0 | — | — | — | — | — | — | — | — | — | |
| Tango-Full-FTInference GPU Memory=5.65GB, #Param=866M2025.12 | 0.95 | — | — | 2 | 12.53 | 7.75 | 0.56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tango2-FullInference GPU Memory=5.65GB, #Param=866M2025.12 | 0.96 | — | — | 2.28 | 13.79 | 8.72 | 0.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tango2Inference GPU Memory=5.65GB, #Param=866M2025.12 | 0.97 | — | — | 2.83 | 14.51 | 8.79 | 0.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IMPACTData=1700, # para=193M, Step=100, Latency=22.342026.05 | 1.06 | 3.47 | 4.38 | 1.26 | 15.25 | 10.57 | 0.372 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AUDIODEARData=1700, # para=191M, Step=1, Latency=2.612026.05 | 1.06 | 3.27 | 4.27 | 2.79 | 18.67 | 9.66 | 0.334 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TangoInference GPU Memory=5.65GB, #Param=866M2025.12 | 1.08 | — | — | 1.44 | 15.09 | 7.41 | 0.54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| STAR-GEN (OURS)PARAMS=905M2026.06 | 1.09 | — | — | — | — | — | 0.48 | — | — | — | — | 55.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TANGO 2PARAMS=866M2026.06 | 1.11 | — | — | — | — | — | 0.44 | — | — | — | — | 108.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TANGO-FULL-FTDatasets=AS+AC+7 others, Dataset Size=1.2M, Text=true, #Params=866M2023.04 | 1.12 | — | — | — | 18.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tango 22025.10 | 1.12 | — | — | 2.63 | 20.66 | 9.09 | 0.375 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tango 2Data=≈ 3333, # para=866M, Step=200, Latency=182.232026.05 | 1.12 | 3.42 | 4.07 | 2.63 | 20.66 | 9.09 | 0.375 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tango 2Model Type=Specialized Models2026.06 | 1.12 | — | — | 2.82 | 11.55 | 10.65 | 0.568 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioLDM-M-Full-FTInference GPU Memory=10.25GB, #Param=416M2025.12 | 1.14 | — | — | 1.52 | 20.03 | 9 | 0.54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AUDIOBOX SOUND2023.12 | 1.15 | 3.43 | 4.09 | 0.77 | 8.3 | 12.7 | 0.71 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AUDIOBOX SOUNDmodel_category=Sound only models2023.12 | 1.15 | — | — | 0.77 | 8.3 | 12.7 | 0.71 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioGANInference GPU Memory=1.34GB, #Param=28M2025.12 | 1.15 | — | — | 1.38 | 12.66 | 9.63 | 0.49 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TangoFluxGenerator Type=Bidirectional2026.01 | 1.16 | — | — | 2.89 | 25.54 | 13.75 | — | — | — | — | — | — | — | — | — | — | — | — | — | 33.43 | 31.36 | 32.94 | 34.68 | 34.28 | 35.05 | — | — | — | — | — | — | — | — | — | — | — | |
| AudioMNTPData=1200, # para=193M, Step=1002026.05 | 1.16 | — | — | 1.68 | 14.81 | 9.67 | 0.336 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TangoFluxData=3700, # para=516M, Step=50, Latency=45.502026.05 | 1.18 | — | — | 2.32 | 19.24 | 12.43 | 0.382 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AUDIOBOXmodel_category=Unified Models2023.12 | 1.19 | — | — | 1.1 | 10.14 | 11.9 | 0.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TangoFlux2026.05 | 1.19 | — | — | — | — | — | 58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 19.13 | 2.26 | — | — | — | — | — | — | — | — | — | |
| Re-AudioLDM-LTraining Dataset=AudioCaps, Retrieval Info=Audio & Text, Retrieval Number=102023.09 | 1.2 | — | — | 1.37 | — | 7.39 | 37.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TANGO-full-FTfine-tuning=full2023.12 | 1.2 | 3.04 | 3.78 | 2.19 | 18.47 | 8.8 | 0.56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TANGO-full-FTmodel_category=Sound only models2023.12 | 1.2 | — | — | 2.19 | 18.47 | 8.8 | 0.56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tango 2NFE=1002024.10 | 1.2 | — | — | 2.84 | — | — | 0.68 | 73.46 | 72.08 | — | — | — | — | — | — | — | — | — | 0.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Re-AudioLDM-LDataset=AudioCaps, Retrieval Info.=Audio & Text, Database & Retrieval No.=AC -> 102025.11 | 1.2 | — | — | — | — | 7.39 | 37.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TangoFlux-RAGDataset=AC+1 other, Retrieval Info.=Audio, Database & Retrieval No.=AS -> 12025.11 | 1.2 | — | — | — | 18.98 | 12.81 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TangoFluxDataset=AC+1 other2025.11 | 1.21 | — | — | — | 19.23 | 12.6 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| STAR-Gen w/ SAO-VAEPARAMS=905M2026.06 | 1.21 | — | — | — | — | — | 0.44 | — | — | — | — | 67.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioLDM2-L-FullInference GPU Memory=10.95GB, #Param=712M2025.12 | 1.22 | — | — | 2.92 | 20.29 | 7.25 | 0.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AUDIODEAR w/o Dist.Data=1700, # para=191M, Step=1, Latency=2.612026.05 | 1.22 | — | — | 3.82 | 22.09 | 8.07 | 0.298 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TANGOFLUXPARAMS=515M2026.06 | 1.22 | — | — | — | — | — | 0.43 | — | — | — | — | 80.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Re-AudioLDM-STraining Dataset=AudioCaps, Retrieval Info=Audio & Text, Retrieval Number=102023.09 | 1.23 | — | — | 1.4 | — | 7.33 | 37.15 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tango-FullInference GPU Memory=5.65GB, #Param=866M2025.12 | 1.23 | — | — | 1.87 | 20.94 | 5.14 | 0.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Audio-AlpacaPreference Tuning=DPO2025.05 | 1.24 | — | — | 3.2 | — | 12.27 | 72.36 | — | — | — | — | — | — | — | — | 44.42 | 0.55 | 2.14 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tango-Full-FT2026.01 | 1.24 | — | — | — | 15.64 | 8.78 | 0.291 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tango-FTTraining=Fine-tuned2026.04 | 1.24 | — | — | 2.68 | 15.64 | 8.78 | 0.291 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioLDM2-FullInference GPU Memory=8.17GB, #Param=346M2025.12 | 1.25 | — | — | 2.74 | 18.5 | 8.08 | 0.46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioLDM-M-Full-FTDatasets=AS+AC+2 others, Dataset Size=3.3M, Text=false, #Params=416M2023.04 | 1.26 | — | — | — | 26.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioLDM-M-Full-FTDatasets=AS+AC+2 others, Text=No, #Params=416M, Fine-tuned=Yes2023.04 | 1.26 | 79.85 | 76.84 | 2.57 | 26.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Re-AudioLDM-STraining Dataset=AudioCaps, Retrieval Info=Audio & Text, Retrieval Number=32023.09 | 1.27 | — | — | 1.48 | — | 7.31 | 37.07 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Siren + Plan-CriticGenerator Type=Unidirectional, Decoding=Plan-Critic-guided prefix search2026.01 | 1.27 | — | — | 1.96 | 15.7 | 13.82 | — | — | — | — | — | — | — | — | — | — | — | — | — | 36.47 | 40.2 | 37.35 | 34.72 | 34.09 | 32.59 | — | — | — | — | — | — | — | — | — | — | — | |
| TangoFlux2026.01 | 1.27 | — | — | — | 20.65 | 12.81 | 0.318 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tango2025.10 | 1.27 | — | — | 1.73 | 24.42 | 7.7 | 0.315 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlashAudioNFE=24, Reflow (R)=true, One-step distillation (D)=false2024.10 | 1.28 | — | — | 1.18 | — | — | 0.658 | 78.86 | 76.98 | — | — | — | — | — | — | — | — | — | 0.054 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GenAUGenerator Type=Bidirectional2026.01 | 1.28 | — | — | 1.73 | 23.01 | 13.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | 34.59 | 33.68 | 34.57 | 34.54 | 35.36 | 34.59 | — | — | — | — | — | — | — | — | — | — | — | |
| AudioLDM-L-FullDatasets=AS + AC + FSD + BBC2023.05 | 1.29 | 65.91 | 65.95 | 1.96 | 23.31 | 8.13 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Audio-AlpacaPreference Tuning=RAFT2025.05 | 1.29 | — | — | 1.93 | — | 10.37 | 72.23 | — | — | — | — | — | — | — | — | 44.85 | 0.53 | 2.45 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EzAudio-XLSize=XL2026.04 | 1.29 | — | — | 3.64 | 14.98 | 11.38 | 0.314 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EzAudio-XLData=> 5500, # para=874M, Step=50, Latency=39.782026.05 | 1.29 | 3.31 | 4.03 | 3.01 | 14.98 | 11.38 | 0.387 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Make-an-Audio 2Data=3700, # para=160M, Step=100, Latency=15.872026.05 | 1.29 | — | — | 2.03 | 16.23 | 9.95 | 0.345 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioTurboData=≈ 2000, # para=1.1B, Step=102026.05 | 1.29 | — | — | — | 20.65 | 9.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlashAudioNFE=4, Reflow (R)=true, One-step distillation (D)=false2024.10 | 1.3 | — | — | 1.26 | — | — | 0.652 | 78.23 | 76.14 | — | — | — | — | — | — | — | — | — | 0.014 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioTurboData=≈ 2000, # para=1.1B, Step=52026.05 | 1.3 | — | — | — | 22.18 | 8.88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T2A-FeedbackPreference Tuning=DPO2025.05 | 1.31 | — | — | 2.64 | — | 11.35 | 74 | — | — | — | — | — | — | — | — | 49.58 | 0.57 | 2.57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ControlAudio2025.10 | 1.31 | — | — | 1.56 | 14.2 | 14.49 | 0.535 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Make-An-Audio 2Prams=937M, DDIM steps=1002023.05 | 1.32 | — | — | 1.8 | 11.75 | 11.16 | 0.645 | 78.31 | 75.63 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TangoTraining Dataset=AudioCaps, Retrieval Info=None, Retrieval Number=None2023.09 | 1.32 | — | — | 1.68 | — | 6.45 | 29.28 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Make-An-Audio 22024.06 | 1.32 | — | — | 1.8 | — | — | 0.645 | 75.31 | 73.44 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Make-An-Audio 2NFE=1002024.10 | 1.32 | — | — | 1.8 | — | — | 0.645 | 75.56 | 73.14 | — | — | — | — | — | — | — | — | — | 0.17 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlashAudioNFE=1, Reflow (R)=true, One-step distillation (D)=true2024.10 | 1.32 | — | — | 1.49 | — | — | 0.648 | 77.56 | 75.43 | — | — | — | — | — | — | — | — | — | 0.0025 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConsistencyTTAData=145, # para=559M, Step=1, Latency=3.032026.05 | 1.32 | 3.01 | 3.92 | 2.83 | 22.21 | 8.92 | 0.328 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioLDM 2-Large2024.06 | 1.33 | — | — | 1.75 | — | — | 0.652 | 75.86 | 73.75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| T2A-FeedbackPreference Tuning=RAFT2025.05 | 1.33 | — | — | 2.29 | — | 11.66 | 73.1 | — | — | — | — | — | — | — | — | 45.53 | 0.51 | 2.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ConsistencyTTANFE=12024.10 | 1.33 | — | — | 2.13 | — | — | 0.655 | 73.19 | 70.08 | — | — | — | — | — | — | — | — | — | 0.004 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFMNFE=242024.10 | 1.34 | — | — | 1.22 | — | — | 0.64 | 76.32 | 74.75 | — | — | — | — | — | — | — | — | — | 0.054 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AuffusionPretrain=true, Duration(h)=145, Params=1.1B2024.01 | 1.36 | — | — | 1.63 | 21.99 | 10.57 | 55.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Auffusion-FullPretrain=true, Duration(h)=1990, Params=1.1B2024.01 | 1.36 | — | — | 1.76 | 23.08 | 10.28 | 55.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SoundCTMNFE=12024.10 | 1.36 | — | — | 1.95 | — | — | 0.656 | 73.87 | 71.16 | — | — | — | — | — | — | — | — | — | 0.01 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GenAU-LSize=L2026.04 | 1.36 | — | — | 2.07 | 14.58 | 10.43 | 0.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SoundCTMData=145, # para=1.2B, Step=1, Latency=2.482026.05 | 1.36 | 3.1 | 3.73 | 2.51 | 19.83 | 7.98 | 0.31 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TANGODatasets=AC, Text=Yes, #Params=866M2023.04 | 1.37 | 85.94 | 80.36 | 1.59 | 24.52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TANGOPrams=1.21B, DDIM steps=1002023.05 | 1.37 | — | — | 1.87 | 26.13 | 8.23 | 0.65 | 74.1 | 72.76 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TANGO2023.12 | 1.37 | 3.1 | 3.51 | 1.57 | 23.78 | 8.3 | 0.51 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Tango2024.06 | 1.37 | — | — | 1.87 | — | — | 0.65 | 74.35 | 72.86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioLCMNFE=22024.10 | 1.37 | — | — | 1.67 | — | — | 0.617 | 76.48 | 73.92 | — | — | — | — | — | — | — | — | — | 0.003 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MMAudioGenerator Type=Bidirectional2026.01 | 1.37 | — | — | 5.51 | 19.06 | 13.78 | — | — | — | — | — | — | — | — | — | — | — | — | — | 31.21 | 32.94 | 31.13 | 31.13 | 30.78 | 28.17 | — | — | — | — | — | — | — | — | — | — | — | |
| AudioXModel Type=Specialized Models2026.06 | 1.37 | — | — | 2.03 | 13.03 | 12.05 | 0.488 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Siren + Plan-Critic + TreeBoNGenerator Type=Unidirectional, Decoding=TreeBoN2026.01 | 1.38 | — | — | 1.97 | 18.26 | 10.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | 34.04 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EzAudio-LData=> 5500, # para=596M, Step=50, Latency=28.932026.05 | 1.38 | — | — | 2.25 | 15.59 | 11.35 | 0.391 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AuffusionPretrain=false, Duration(h)=145, Params=1.1B2024.01 | 1.39 | — | — | 2.25 | 24.45 | 10.14 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioComposerScale=L2025.10 | 1.39 | — | — | 2.52 | 19.25 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Audio-OmniModel Type=Unified Models2026.06 | 1.39 | — | — | 2 | 45.43 | 9.94 | 0.498 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UATModel Type=Unified Models2026.06 | 1.39 | — | — | 2.87 | 14.47 | 12.47 | 0.491 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoDiDatasets=AS + AC + FSD + BBC + SDN2023.05 | 1.4 | 66.87 | 67.6 | 1.8 | 22.9 | 8.77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoDi2023.12 | 1.4 | — | — | 1.8 | — | 8.77 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlashAudioNFE=1, Reflow (R)=true, One-step distillation (D)=false2024.10 | 1.4 | — | — | 2.24 | — | — | 0.63 | 72.67 | 70.84 | — | — | — | — | — | — | — | — | — | 0.0025 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioLDM22026.05 | 1.41 | — | — | — | — | — | 47.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 21.84 | 2.29 | — | — | — | — | — | — | — | — | — | |
| TangoPretrain=false, Duration(h)=145, Params=1.3B2024.01 | 1.43 | — | — | 1.77 | 24.82 | 7.2 | 55 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioGen-Large2024.06 | 1.43 | — | — | 1.74 | — | — | 0.601 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AudioGen-Large2024.10 | 1.43 | — | — | 1.74 | — | — | 0.601 | — | — | — | — | — | — | — | — | — | — | — | 1.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniFlow-Audio2026.05 | 1.43 | — | — | — | — | — | 47.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 17.18 | 5.74 | — | — | — | — | — | — | — | — | — | |
| Make-an-Audio 22025.05 | 1.44 | — | — | 1.82 | — | 10.03 | 69.97 | — | — | — | — | — | — | — | — | 42.05 | 0.53 | 2.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Audiobox TTA-RAGDataset=AudioCaps, Retrieval Info.=Audio, Database & Retrieval No.=AC -> 32025.11 | 1.44 | — | — | — | — | 8.4 | 37.37 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CFG-onlyCFG scale w=7, NFE=4002025.09 | 1.44 | — | — | 1.76 | 20.94 | 13.46 | 0.54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MoG-HGw1=4.0, w2=3.3, w3=1.2, NFE=4002025.09 | 1.44 | — | — | 1.38 | 18.87 | 13.58 | 0.54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Next-DiTdual-encoder=true, fine-tuned on AudioCaps=true2024.06 | 1.45 | — | — | 1.03 | — | — | 0.63 | 77.53 | 76.52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Auffusion-FullPretrain=false, Duration(h)=1990, Params=1.1B2024.01 | 1.46 | — | — | 1.67 | 24.11 | 8.39 | 51.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |