Audio Reconstruction on LibriSpeech (other)
5.49WERX-Codec
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| X-Codec#C=8, Frame Rate=50Hz, BPS=4000, Tokenizer Type=Semantic Distilled2025.09 | 5.49 | 3.19 | |
| X-Codec#C=3, Frame Rate=50Hz, BPS=1500, Tokenizer Type=Semantic Distilled2025.09 | 6.11 | 3.17 | |
| SpeechTokenizer#C=8, Frame Rate=50Hz, BPS=4000, Tokenizer Type=Semantic Distilled2025.09 | 6.58 | 3.1 | |
| StableToken#C=1, Frame Rate=25Hz, BPS=325, Tokenizer Type=Supervised Semantic2025.09 | 7.99 | 3.83 | |
| X-Codec#C=1, Frame Rate=50Hz, BPS=500, Tokenizer Type=Semantic Distilled2025.09 | 9.02 | 3.04 | |
| GLM-4-Voice-Token#C=1, Frame Rate=12.5Hz, BPS=175, Tokenizer Type=Supervised Semantic2025.09 | 9.33 | 3.99 | |
| CosyVoice2#C=1, Frame Rate=25Hz, BPS=325, Tokenizer Type=Supervised Semantic2025.09 | 9.68 | 3.25 | |
| Mimi#C=8, Frame Rate=12.5Hz, BPS=1100, Tokenizer Type=Semantic Distilled2025.09 | 9.84 | 3.06 | |
| SpeechTokenizer#C=3, Frame Rate=50Hz, BPS=1500, Tokenizer Type=Semantic Distilled2025.09 | 10.72 | 2.89 | |
| S3 Tokenizer#C=1, Frame Rate=25Hz, BPS=300, Tokenizer Type=Supervised Semantic2025.09 | 13.38 | 3.31 | |
| SpeechTokenizer#C=1, Frame Rate=50Hz, BPS=500, Tokenizer Type=Semantic Distilled2025.09 | 16.06 | 2.49 |