Audio Reconstruction on LibriSpeech (clean)
3.09WERX-Codec
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| X-Codec#C=8, Frame Rate=50Hz, BPS=4000, Tokenizer Type=Semantic Distilled2025.09 | 3.09 | 3.47 | |
| X-Codec#C=3, Frame Rate=50Hz, BPS=1500, Tokenizer Type=Semantic Distilled2025.09 | 3.16 | 3.43 | |
| SpeechTokenizer#C=8, Frame Rate=50Hz, BPS=4000, Tokenizer Type=Semantic Distilled2025.09 | 3.21 | 3.32 | |
| StableToken#C=1, Frame Rate=25Hz, BPS=325, Tokenizer Type=Supervised Semantic2025.09 | 3.84 | 4.09 | |
| X-Codec#C=1, Frame Rate=50Hz, BPS=500, Tokenizer Type=Semantic Distilled2025.09 | 3.98 | 3.17 | |
| SpeechTokenizer#C=3, Frame Rate=50Hz, BPS=1500, Tokenizer Type=Semantic Distilled2025.09 | 4.03 | 3 | |
| GLM-4-Voice-Token#C=1, Frame Rate=12.5Hz, BPS=175, Tokenizer Type=Supervised Semantic2025.09 | 4.04 | 4.07 | |
| CosyVoice2#C=1, Frame Rate=25Hz, BPS=325, Tokenizer Type=Supervised Semantic2025.09 | 4.25 | 3.36 | |
| Mimi#C=8, Frame Rate=12.5Hz, BPS=1100, Tokenizer Type=Semantic Distilled2025.09 | 4.65 | 3.26 | |
| SpeechTokenizer#C=1, Frame Rate=50Hz, BPS=500, Tokenizer Type=Semantic Distilled2025.09 | 4.77 | 2.51 | |
| S3 Tokenizer#C=1, Frame Rate=25Hz, BPS=300, Tokenizer Type=Supervised Semantic2025.09 | 5.78 | 3.4 |