Text-To-Music on Downstream Audio Generation (TTM)
0.386CLAP ScoreAudioX
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| AudioXType=Unified2026.06 | 0.386 | — | — | — | |
| Foley-OmniType=Unified2026.06 | 0.374 | — | — | — | |
| LoSATokLatent Dim.=128, DiT Dim.=512, # Param=208M, Training Protocol=Multi-task Joint Training2026.05 | 0.3 | 3.366 | 20.127 | 1.628 | |
| LoSATokLatent Dim.=128, DiT Dim.=512, # Param=208M, Training Protocol=Single-task Training2026.05 | 0.282 | 4.156 | 25.089 | 1.788 | |
| UniFlow-AudioLatent Dim.=128, DiT Dim.=512, # Param=208M, Training Protocol=Multi-task Joint Training2026.05 | 0.272 | 4.752 | 28.173 | 1.724 | |
| DashengTokenizerLatent Dim.=1280, DiT Dim.=1536, # Param=975M, Training Protocol=Single-task Training2026.05 | 0.268 | 3.78 | 25.848 | 1.751 | |
| DashengTokenizerLatent Dim.=1280, DiT Dim.=1536, # Param=322M, Training Protocol=Multi-task Joint Training2026.05 | 0.268 | 5.78 | 36.227 | 1.797 | |
| UniFlow-AudioLatent Dim.=128, DiT Dim.=512, # Param=208M, Training Protocol=Single-task Training2026.05 | 0.25 | 6.147 | 36.098 | 1.807 | |
| MusicGenType=TTM2026.06 | 0.245 | — | — | — | |
| UniFlow-AudioType=Unified2026.06 | 0.241 | — | — | — | |
| DashengTokenizerLatent Dim.=1280, DiT Dim.=1536, # Param=322M, Training Protocol=Single-task Training2026.05 | 0.237 | 8.46 | 51.246 | 1.832 | |
| DashengTokenizerLatent Dim.=1280, DiT Dim.=512, # Param=215M, Training Protocol=Single-task Training2026.05 | 0.027 | 23.257 | 131.417 | 5.068 |