Environment-aware Text-to-Speech on Seed-TTS AudioCaps en (test)
2.28WERCosyVoice2 + TangoFlux
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CosyVoice2 + TangoFluxmixing_mode=separately generated speech and background audio2026.05 | 2.28 | 3.11 | 0.287 | |
| ImmersiveTTS2026.05 | 4.48 | 3.92 | 0.207 | |
| VoiceDiT2026.05 | 7.08 | 5.37 | 0.134 | |
| VoiceLDM2026.05 | 11.2 | 6.98 | 0.118 | |
| AudioLDM2 (Speech)sub-modality=speech only2026.05 | 27.23 | 28.14 | -0.069 | |
| AudioLDM2 (Speech) + AudioLDM2 (Audio)mixing_mode=separately generated speech and background audio2026.05 | 35.78 | 3.39 | 0.236 |