Text-To-Audio on Downstream Audio Generation TTA
1.987FADLoSATok
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LoSATokLatent Dim.=128, DiT Dim.=512, # Param=208M, Training Protocol=Multi-task Joint Training2026.05 | 1.987 | 21.363 | 1.7 | 39.6 | |
| LoSATokLatent Dim.=128, DiT Dim.=512, # Param=208M, Training Protocol=Single-task Training2026.05 | 2.76 | 25.743 | 1.844 | 38.1 | |
| UniFlow-AudioLatent Dim.=128, DiT Dim.=512, # Param=208M, Training Protocol=Multi-task Joint Training2026.05 | 4.066 | 37.217 | 2.554 | 25.2 | |
| DashengTokenizerLatent Dim.=1280, DiT Dim.=1536, # Param=975M, Training Protocol=Single-task Training2026.05 | 4.138 | 24.605 | 1.738 | 37.9 | |
| DashengTokenizerLatent Dim.=1280, DiT Dim.=1536, # Param=322M, Training Protocol=Multi-task Joint Training2026.05 | 4.482 | 37.146 | 2.137 | 28.3 | |
| UniFlow-AudioLatent Dim.=128, DiT Dim.=512, # Param=208M, Training Protocol=Single-task Training2026.05 | 4.925 | 40.017 | 2.613 | 24.3 | |
| DashengTokenizerLatent Dim.=1280, DiT Dim.=1536, # Param=322M, Training Protocol=Single-task Training2026.05 | 7.238 | 43.916 | 2.395 | 24.5 | |
| DashengTokenizerLatent Dim.=1280, DiT Dim.=512, # Param=215M, Training Protocol=Single-task Training2026.05 | 34.681 | 115.557 | 4.109 | 0.2 |