Timing-Controlled Audio Generation on AudioCondition (test)
1.6EbTango
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| TangoEfficiency (RTF)=1.2072025.10 | 1.6 | 26.51 | 2.82 | 1.93 | 0.245 | 1.68 | 2.58 | |
| AudioLDMModel Scale=Large, Efficiency (RTF)=1.1412025.10 | 6.79 | 35.66 | 3.95 | 2.46 | 0.26 | 1.84 | 2.4 | |
| AudioLDM 2Model Scale=Full Large, Efficiency (RTF)=1.4962025.10 | 6.93 | 20.47 | 3.68 | 2.15 | 0.283 | — | — | |
| AudioLDM 2Model Scale=Large, Efficiency (RTF)=1.4962025.10 | 7.75 | 42.41 | 3.07 | 1.92 | 0.279 | — | — | |
| Stable AudioEfficiency (RTF)=0.821, trained by authors=true2025.10 | 11.28 | 51.67 | 1.93 | 1.75 | 0.318 | 1.94 | 3.44 | |
| CCTAEfficiency (RTF)=1.2072025.10 | 14.57 | 18.27 | — | — | — | — | — | |
| Tango + LControlEfficiency (RTF)=1.2072025.10 | 21.46 | 55.15 | — | — | — | — | — | |
| TG-DiffEfficiency (RTF)=1.207, SED model=Turpault et al., 20192025.10 | 26.7 | 60.06 | 2.66 | — | 0.244 | — | — | |
| MC-Diffusion2025.10 | 29.07 | 47.11 | — | — | — | — | — | |
| Ground Truth2025.10 | 43.37 | 67.53 | — | — | 0.377 | 4.52 | 4.48 | |
| AudioComposerModel Scale=Small, Efficiency (RTF)=0.7212025.10 | 43.51 | 60.83 | 4.92 | 2 | 0.261 | 3.12 | 2.52 | |
| FreeAudioEfficiency (RTF)=1.1662025.10 | 44.34 | 68.5 | 1.92 | 1.73 | 0.321 | — | — | |
| AudioComposerModel Scale=Large2025.10 | 44.4 | 63.3 | — | — | — | — | — | |
| ControlAudioPrompt set coverage=all event classes, Efficiency (RTF)=0.8212025.10 | 49.85 | 71.55 | 1.47 | 1.3 | 0.356 | 3.96 | 3.75 | |
| ControlAudioEfficiency (RTF)=0.8212025.10 | 55.58 | 79.52 | 2.61 | 1.85 | 0.325 | 4.17 | 3.41 |