Response Ranking on ParaS2SBench
4.42Age Scoregpt-4o-mini-tts (good)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| gpt-4o-mini-tts (good)Judge=Auto, Model Category=TTS-based2025.11 | 4.42 | 4.646 | 4.739 | 4.79 | 4.649 | |
| SesameJudge=Auto, Model Category=TTS-based2025.11 | 4.412 | 4.512 | 4.701 | 4.71 | 4.583 | |
| YourTTSJudge=Auto, Model Category=TTS-based2025.11 | 4.41 | 4.302 | 4.534 | 4.58 | 4.457 | |
| gpt-4o-mini-tts (good)Judge=Human, Model Category=TTS-based2025.11 | 4.38 | 4.654 | 4.506 | 4.337 | 4.469 | |
| CosyVoiceJudge=Auto, Model Category=TTS-based2025.11 | 4.38 | 4.417 | 4.612 | 4.68 | 4.522 | |
| SesameJudge=Human, Model Category=TTS-based2025.11 | 4.216 | 4.324 | 4.332 | 4.182 | 4.263 | |
| YourTTSJudge=Human, Model Category=TTS-based2025.11 | 4.037 | 3.801 | 4.23 | 3.804 | 3.968 | |
| CosyVoiceJudge=Human, Model Category=TTS-based2025.11 | 3.994 | 4.012 | 4.201 | 3.864 | 4.018 | |
| Qwen2.5 OmniJudge=Auto, Model Category=S2S models2025.11 | 2.93 | 3.68 | 2.933 | 2.91 | 3.113 | |
| Qwen2.5 OmniJudge=Human, Model Category=S2S models2025.11 | 2.728 | 2.522 | 3.493 | 2.509 | 2.863 | |
| gpt-4o-audio-previewJudge=Auto, Model Category=S2S models2025.11 | 2.685 | 3.711 | 3.096 | 2.815 | 3.077 | |
| gpt-4o-audio-previewJudge=Human, Model Category=S2S models2025.11 | 2.63 | 2.713 | 3.682 | 2.611 | 2.909 | |
| GLM-4-VoiceJudge=Auto, Model Category=S2S models2025.11 | 2.57 | 3.489 | 2.821 | 2.72 | 2.9 | |
| GLM-4-VoiceJudge=Human, Model Category=S2S models2025.11 | 2.493 | 2.384 | 3.521 | 2.301 | 2.675 | |
| gpt-4o-mini-tts (bad)Judge=Auto, Model Category=TTS-based2025.11 | 1.215 | 1.159 | 1.325 | 1.21 | 1.227 | |
| gpt-4o-mini-tts (bad)Judge=Human, Model Category=TTS-based2025.11 | 1.177 | 1.041 | 1.59 | 1.251 | 1.265 |