Text-To-Speech on Downstream Audio Generation TTS
3.03WERLoSATok
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LoSATokLatent Dim.=128, DiT Dim.=512, # Param=208M, Training Protocol=Single-task Training2026.05 | 3.03 | 54.8 | 3.367 | |
| UniFlow-AudioLatent Dim.=128, DiT Dim.=512, # Param=208M, Training Protocol=Single-task Training2026.05 | 3.589 | 40.8 | 2.768 | |
| DashengTokenizerLatent Dim.=1280, DiT Dim.=1536, # Param=975M, Training Protocol=Single-task Training2026.05 | 3.652 | 28.7 | 3.144 | |
| LoSATokLatent Dim.=128, DiT Dim.=512, # Param=208M, Training Protocol=Multi-task Joint Training2026.05 | 3.667 | 50.7 | 3.31 | |
| UniFlow-AudioLatent Dim.=128, DiT Dim.=512, # Param=208M, Training Protocol=Multi-task Joint Training2026.05 | 4.529 | 34.4 | 2.259 | |
| DashengTokenizerLatent Dim.=1280, DiT Dim.=1536, # Param=322M, Training Protocol=Single-task Training2026.05 | 75.469 | 10.3 | 1.322 | |
| DashengTokenizerLatent Dim.=1280, DiT Dim.=1536, # Param=322M, Training Protocol=Multi-task Joint Training2026.05 | 84.761 | 7.4 | 1.296 | |
| DashengTokenizerLatent Dim.=1280, DiT Dim.=512, # Param=215M, Training Protocol=Single-task Training2026.05 | 100 | 1.5 | 1.251 |