Speech Generation on Long-Audio benchmark Chinese
5.95CERFish Audio S2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Fish Audio S22026.03 | 5.95 | 0.557 | 0.0923 | |
| Fish Audio S12026.03 | 6.44 | 0.505 | 0.108 | |
| Qwen3-TTS2026.03 | 8.09 | 0.574 | 0.0614 | |
| VibeVoice2026.03 | 26.2 | 0.609 | 0.0537 |
| Method | Links | |||
|---|---|---|---|---|
| Fish Audio S22026.03 | 5.95 | 0.557 | 0.0923 | |
| Fish Audio S12026.03 | 6.44 | 0.505 | 0.108 | |
| Qwen3-TTS2026.03 | 8.09 | 0.574 | 0.0614 | |
| VibeVoice2026.03 | 26.2 | 0.609 | 0.0537 |