Audio Reconstruction on SEED zh
1.74WERX-Codec
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| X-Codec#C=8, Frame Rate=50Hz, BPS=4000, Tokenizer Type=Semantic Distilled2025.09 | 1.74 | 3.33 | |
| X-Codec#C=3, Frame Rate=50Hz, BPS=1500, Tokenizer Type=Semantic Distilled2025.09 | 2.24 | 3.38 | |
| SpeechTokenizer#C=8, Frame Rate=50Hz, BPS=4000, Tokenizer Type=Semantic Distilled2025.09 | 2.25 | 3.44 | |
| StableToken#C=1, Frame Rate=25Hz, BPS=325, Tokenizer Type=Supervised Semantic2025.09 | 2.62 | 4.18 | |
| StableToken#C=1, Frame Rate=25Hz, BPS=3252025.09 | 2.62 | 4.18 | |
| CosyVoice2#C=1, Frame Rate=25Hz, BPS=325, Tokenizer Type=Supervised Semantic2025.09 | 2.75 | 3.58 | |
| CosyVoice2#C=1, Frame Rate=25Hz, BPS=3252025.09 | 2.75 | 3.58 | |
| Mimi#C=8, Frame Rate=12.5Hz, BPS=1100, Tokenizer Type=Semantic Distilled2025.09 | 2.81 | 3.19 | |
| GLM-4-Voice-Token#C=1, Frame Rate=12.5Hz, BPS=175, Tokenizer Type=Supervised Semantic2025.09 | 3.23 | 4.1 | |
| GLM-4-Voice-Token.#C=1, Frame Rate=12.5Hz, BPS=1752025.09 | 3.23 | 4.1 | |
| S3 Tokenizer#C=1, Frame Rate=25Hz, BPS=300, Tokenizer Type=Supervised Semantic2025.09 | 4.26 | 3.31 | |
| S3 Tokenizer#C=1, Frame Rate=25Hz, BPS=3002025.09 | 4.26 | 3.31 | |
| X-Codec#C=1, Frame Rate=50Hz, BPS=500, Tokenizer Type=Semantic Distilled2025.09 | 5.96 | 3.18 | |
| SpeechTokenizer#C=3, Frame Rate=50Hz, BPS=1500, Tokenizer Type=Semantic Distilled2025.09 | 7.81 | 3.06 | |
| SpeechTokenizer#C=1, Frame Rate=50Hz, BPS=500, Tokenizer Type=Semantic Distilled2025.09 | 74.98 | 2.44 |