Audio Reconstruction on SEED en
2.25Word Error Rate (WER)X-Codec
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| X-Codec#C=8, Frame Rate=50Hz, BPS=4000, Tokenizer Type=Semantic Distilled2025.09 | 2.25 | 3.19 | |
| UniAudio-TokenFrame Rate=25Hz, BPS=3252026.05 | 2.55 | 4.13 | |
| X-Codec#C=3, Frame Rate=50Hz, BPS=1500, Tokenizer Type=Semantic Distilled2025.09 | 2.74 | 3.19 | |
| SpeechTokenizer#C=8, Frame Rate=50Hz, BPS=4000, Tokenizer Type=Semantic Distilled2025.09 | 2.77 | 3.22 | |
| StableToken#C=1, Frame Rate=25Hz, BPS=325, Tokenizer Type=Supervised Semantic2025.09 | 3.44 | 4.01 | |
| StableToken#C=1, Frame Rate=25Hz, BPS=3252025.09 | 3.44 | 4.01 | |
| StableTokenFrame Rate=25Hz, BPS=3252026.05 | 3.44 | 4.01 | |
| GLM-4-Voice-Token#C=1, Frame Rate=12.5Hz, BPS=175, Tokenizer Type=Supervised Semantic2025.09 | 3.54 | 4.16 | |
| GLM-4-Voice-Token.#C=1, Frame Rate=12.5Hz, BPS=1752025.09 | 3.54 | 4.16 | |
| GLM-4-Voice-TokenizerFrame Rate=12.5Hz, BPS=1752026.05 | 3.54 | 4.16 | |
| Mimi#C=8, Frame Rate=12.5Hz, BPS=1100, Tokenizer Type=Semantic Distilled2025.09 | 3.86 | 3.15 | |
| CosyVoice2#C=1, Frame Rate=25Hz, BPS=325, Tokenizer Type=Supervised Semantic2025.09 | 4.34 | 3.31 | |
| CosyVoice2#C=1, Frame Rate=25Hz, BPS=3002025.09 | 4.34 | 3.31 | |
| CosyVoice2Frame Rate=25Hz, BPS=3252026.05 | 4.34 | 3.31 | |
| X-Codec#C=1, Frame Rate=50Hz, BPS=500, Tokenizer Type=Semantic Distilled2025.09 | 4.72 | 3.05 | |
| SpeechTokenizer#C=3, Frame Rate=50Hz, BPS=1500, Tokenizer Type=Semantic Distilled2025.09 | 4.93 | 2.89 | |
| WavTokenizerFrame Rate=75Hz, BPS=9002026.05 | 5.6 | 3.01 | |
| S3 Tokenizer#C=1, Frame Rate=25Hz, BPS=300, Tokenizer Type=Supervised Semantic2025.09 | 5.91 | 3.4 | |
| S3 Tokenizer#C=1, Frame Rate=25Hz, BPS=3002025.09 | 5.91 | 3.4 | |
| SpeechTokenizer#C=1, Frame Rate=50Hz, BPS=500, Tokenizer Type=Semantic Distilled2025.09 | 10.37 | 2.51 |