Speech Generation on Long-Audio benchmark English
4.38WERFish Audio S2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Fish Audio S22026.03 | 4.38 | 0.523 | 0.0761 | |
| Fish Audio S12026.03 | 6.26 | 0.436 | 0.108 | |
| Qwen3-TTS2026.03 | 7.69 | 0.39 | 0.0737 | |
| VibeVoice2026.03 | 28 | 0.53 | 0.0572 |
| Method | Links | |||
|---|---|---|---|---|
| Fish Audio S22026.03 | 4.38 | 0.523 | 0.0761 | |
| Fish Audio S12026.03 | 6.26 | 0.436 | 0.108 | |
| Qwen3-TTS2026.03 | 7.69 | 0.39 | 0.0737 | |
| VibeVoice2026.03 | 28 | 0.53 | 0.0572 |