Speech Reconstruction on SeedTTS en (test)
0.0214WERGround Truth
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Ground Truth2026.02 | 0.0214 | 0.73 | 3.53 | |
| DualCodecFPS/TPS=12.5/75, CN=6, BR (kbps)=0.9252026.02 | 0.0263 | 0.624 | 3.78 | |
| X-codec 2FPS/TPS=50/50, CN=1, BR (kbps)=0.82026.02 | 0.0263 | 0.62 | 3.68 | |
| SiTokFPS/TPS=12.5/50, CN=4, BR (kbps)=0.72026.02 | 0.028 | 0.66 | 3.46 | |
| Vevo TokenizerFPS/TPS=50/50, CN=1, BR (kbps)=0.652026.02 | 0.0304 | 0.534 | 3.5 | |
| BiCodecFPS/TPS=50/50, CN=1, BR (kbps)=0.652026.02 | 0.0305 | 0.612 | 3.68 | |
| SiTokFPS/TPS=12.5/25, CN=2, BR (kbps)=0.352026.02 | 0.0317 | 0.658 | 3.44 | |
| BigCodecFPS/TPS=80/80, CN=1, BR (kbps)=1.042026.02 | 0.0325 | 0.615 | 3.59 | |
| SiTokFPS/TPS=12.5/12.5, CN=1, BR (kbps)=0.2, Token CFG=true2026.02 | 0.0334 | 0.635 | 3.6 | |
| FireRedTTS TokenizerFPS/TPS=25/25, CN=1, BR (kbps)=0.352026.02 | 0.0335 | 0.597 | 3.4 | |
| SiTokFPS/TPS=12.5/12.5, CN=1, BR (kbps)=0.2, Decoder Finetuning=true2026.02 | 0.0379 | 0.682 | 3.48 | |
| SiTokFPS/TPS=12.5/12.5, CN=1, BR (kbps)=0.22026.02 | 0.0406 | 0.641 | 3.44 | |
| MimiFPS/TPS=12.5/75, CN=6, BR (kbps)=0.8252026.02 | 0.0451 | 0.527 | 3.09 | |
| SemantiCodecFPS/TPS=25/50, CN=2, BR (kbps)=0.6752026.02 | 0.0511 | 0.488 | 2.83 | |
| CosyVoice TokenizerFPS/TPS=25/25, CN=1, BR (kbps)=0.32026.02 | 0.0563 | 0.465 | 3.65 | |
| WavTokenizerFPS/TPS=75/75, CN=1, BR (kbps)=0.92026.02 | 0.0665 | 0.483 | 3.36 | |
| SpeechTokenizerFPS/TPS=50/100, CN=2, BR (kbps)=12026.02 | 0.0798 | 0.468 | 2.47 | |
| StableCodecFPS/TPS=25/25, CN=1, BR (kbps)=0.42026.02 | 0.111 | 0.41 | 3.87 | |
| Factorized FSQFrame Rate=25 Hz2026.06 | 3.04 | 0.67 | 3.71 | |
| Factorized FSQFrame Rate=4.17 Hz2026.06 | 3.37 | 0.65 | 3.79 | |
| CosyVoice2Frame Rate=25 Hz2026.06 | 4.1 | 0.68 | 3.65 |