Speech Reconstruction on SEED-ZH
4.21PESQMingTok-Audio
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MingTok-AudioFramerate=502026.02 | 4.21 | — | 0.98 | |
| Ming-UniAudioFrame Rate=50, RTF=0.00502026.05 | 4.199 | — | 0.983 | |
| DashengTokenizerFrame Rate=25, RTF=0.00342026.05 | 4.164 | — | 0.988 | |
| DashengTokenizerFramerate=252026.02 | 4.163 | — | 0.988 | |
| UniFlow-AudioFramerate=502026.02 | 4.048 | — | 0.99 | |
| UniFlow-AudioFrame Rate=50, RTF=0.01672026.05 | 4.04 | — | 0.991 | |
| DACFrame Rate=50, RTF=0.00432026.05 | 3.877 | — | 0.967 | |
| DACFramerate=502026.02 | 3.86 | — | 0.967 | |
| EzAudioFramerate=502026.02 | 3.857 | — | 0.987 | |
| EzAudioFrame Rate=50, RTF=0.00542026.05 | 3.85 | — | 0.987 | |
| LoSATokFrame Rate=25, RTF=0.00332026.05 | 3.157 | — | 0.947 | |
| H-Codec-2.0 (Large)FS=48k, FPS=6.25, Paras=1.2B2025.12 | 2.88 | 0.91 | 0.93 | |
| MiMo-Audio-TokenizerFS=24k, FPS=25, Paras=1.2B2025.12 | 2.71 | 0.89 | 0.93 | |
| H-Codec-2.0 (Small)FS=48k, FPS=6.25, Paras=236M2025.12 | 2.43 | 0.86 | 0.9 | |
| H-Codec-1.5FS=16k, FPS=18.80/20.18, Paras=678M2025.12 | 2.4 | 0.85 | 0.9 | |
| H-Codec-1.0FS=16k, FPS=25, Paras=146M2025.12 | 2.35 | 0.8 | 0.9 | |
| XY-TokenizerFrame Rate=12.5, RTF=0.00992026.05 | 2.319 | — | 0.909 | |
| XY-TokenizerFS=16k, FPS=12.5, Paras=-2025.12 | 2.27 | 0.77 | 0.9 | |
| XY-TokenizerFramerate=12.52026.02 | 2.27 | — | 0.9 | |
| BigCodecFS=16k, FPS=80, Paras=159M2025.12 | 2.26 | 0.81 | 0.92 | |
| X-Codec2FS=16k, FPS=50, Paras=242M2025.12 | 2.19 | 0.8 | 0.92 | |
| XCodec 2.0Framerate=502026.02 | 2.19 | — | 0.92 | |
| MimiFS=16k, FPS=12.5, Paras=79M2025.12 | 2.05 | 0.73 | 0.89 | |
| MimiFramerate=12.52026.02 | 2.05 | — | 0.89 | |
| FlexiCodecFS=16k, FPS=7.16/8.49, Paras=216M2025.12 | 1.88 | 0.67 | 0.86 | |
| SNACRTF=0.00192026.05 | 1.879 | — | 0.867 | |
| SNACFramerate=-2026.02 | 1.841 | — | 0.862 | |
| Baichuan-Audio-TokenizerFS=16k, FPS=12.5, Paras=-2025.12 | 1.84 | 0.78 | 0.86 | |
| GLM4-Voice-TokenizerFS=16k, FPS=12.5, Paras=-2025.12 | 1.06 | 0.33 | 0.61 |